Cómo clasifiqué estos modelos
Tres factores de entrada, en este orden.
- Calidad — Elo de Artificial Analysis Image Arena, donde las personas eligen entre dos imágenes generadas a partir del mismo prompt sin saber qué modelo creó cada una. Es la señal menos manipulable que tenemos. Una salvedad importante: Elo mide la preferencia humana media, no tu tarea específica. Un modelo que gana en retratos puede perder en tipografía.
- Precio — obtenido de la página activa de cada modelo en GPT Proto el día que escribí esto. Las API de imágenes cambian de precio con frecuencia; consulta la página antes de comprometer un presupuesto basándote en una cifra que leíste en un artículo.
- Integración — autenticación, modo síncrono frente a asíncrono y gestión de errores. La parte que la mayoría de las listas omite y que te encuentras desde el primer día.
Ese es mi marco de análisis, no un dogma. Si tu único criterio es «los píxeles más baratos que no se vean mal», ve directamente al final de la tabla.
La comparación de un vistazo
| Modelo |
Proveedor |
Elo de la Arena |
Precio de GPT Proto |
Facturación |
Mejor para |
| GPT Image 2 |
OpenAI |
1339 |
$6.4 / $24 por cada 1 millón de tokens |
por consumo |
Calidad superior, renderizado de texto |
| GPT Image 1.5 |
OpenAI |
1265 |
$5.6 / $22.4 por cada 1 millón de tokens |
por consumo |
Calidad cercana a la insignia, opción GPT más económica |
| Nano Banana Pro (Gemini 3 Pro Image) |
Google |
nivel superior* |
$0.0804 / imagen |
por imagen |
Recursos profesionales en 4K |
| Nano Banana 2 (Gemini 3.1 Flash Image) |
Google |
1255 |
$0.0402 / imagen |
por imagen |
Generación de gran volumen, mejor relación calidad-precio |
| Seedream 5.0 |
ByteDance |
nivel 9 superior* |
$0.0298 / imagen |
por imagen |
Fotorrealismo, alta resolución nativa |
| Wan 2.5 |
Alibaba |
aún no clasificado |
$0.027 / imagen |
por imagen |
Prompts multilingües, prompts negativos |
| Kling Image O1 |
Kling |
aún no clasificado |
$0.0224 / imagen |
por imagen |
El más barato que se puede usar, detalle cinematográfico |
* Nano Banana Pro y Seedream 5.0 no aparecían como entradas individuales en la clasificación de la Arena en el momento de la redacción; sus modelos hermanos y predecesores se encuentran en el nivel superior. Lo he señalado en lugar de atribuirles una cifra que no les corresponde.
Dos columnas de esa tabla sí hacen un trabajo que el resto de esta lista ignora. La facturación divide claramente el campo: GPT Image cobra por token, por lo que el coste de una sola imagen cambia según el tamaño y la calidad y resulta realmente difícil de predecir a escala. Los otros cinco cobran una tarifa fija por imagen — aburrido y exactamente lo que quiere tu equipo financiero. Todos los precios de GPT Proto anteriores también están por debajo de la tarifa de referencia de mercado del modelo, así que esta vez «más barato» es una afirmación respaldada por los números y no un eslogan.
Los siete modelos
1. GPT Image 2 — el modelo a superar
GPT Image 2 lidera la Text-to-Image Arena de Artificial Analysis con un Elo de 1339 en aproximadamente 11.480 comparaciones a ciegas. No es una ventaja ajustada. Está cómodamente por encima del resto del campo, y esa es la razón de su renderizado de texto y seguimiento de instrucciones. OpenAI lo lanzó el 21 de abril de 2026.
El coste de esa calidad es real, por partida doble. Primero, se factura por tokens a $6.4 por cada millón de tokens de entrada y $24 por cada millón de tokens de salida en GPT Proto, por lo que una imagen de alta calidad de 1024×1024 cuesta más que un borrador rápido y tu gasto por imagen cambia con cada modificación de tamaño y calidad. Segundo, los prompts complejos pueden tardar hasta dos minutos en devolverse — está bien para un trabajo por lotes, pero resulta frustrante detrás de un botón que un usuario está esperando.
Sin embargo, aquí desaparece un punto de fricción. Si accedes directamente, la familia GPT Image requiere la verificación de la organización de la API de OpenAI antes de la primera llamada. A través de GPT Proto te autenticas con la clave de la plataforma y omites por completo ese paso.
Ideal para: la imagen principal, el póster de campaña o cualquier elemento donde un gran resultado sea mejor que diez baratos. Precio: $6.4 / $24 por cada millón de tokens. Página: gpt-image-2.

2. GPT Image 1.5 — casi toda la calidad, una factura menor
GPT Image 1.5 tiene un Elo de 1265, segundo en la clasificación y cerca de su sucesor. En GPT Proto funciona a $5.6 / $22.4 por cada millón de tokens — más barato que GPT Image 2 en ambos conceptos. Si ya utilizas el formato de imágenes de OpenAI y no necesitas estar en lo más alto de la tabla, es la opción pragmática.
El inconveniente: utiliza el mismo modelo de facturación por consumo, por lo que se aplica la misma imprevisibilidad presupuestaria. Cambias un poco de calidad por un poco de ahorro; no escapas del contador de tokens.
Ideal para: equipos que quieren resultados y consistencia de la familia GPT sin pagar el precio del modelo insignia. Precio: $5.6 / $22.4 por cada millón de tokens. Página: gpt-image-1.5.
3. Nano Banana Pro (Gemini 3 Pro Image) — el especialista en 4K
Gemini 3 Pro Image Preview de Google — el modelo al que la comunidad llama Nano Banana Pro — está diseñado para producir recursos profesionales, con un razonamiento optimizado para composiciones complejas. Genera en 1K, 2K y 4K, admite hasta 14 imágenes de referencia y, en los prompts que probé, conservó detalles de piel, cabello e iluminación que los modelos de nivel flash difuminan al ampliar mucho la imagen.
Es la más cara de las dos opciones Gemini, a $0.0804 por imagen — aproximadamente el doble que Nano Banana 2. Pagas por el límite de resolución y el razonamiento. Para una miniatura o una tarjeta social, pagarías de más; para un recurso visual principal con resolución de impresión, no.
Ideal para: salida 4K, impresión y cualquier uso en el que vayas a ampliar y juzgar la imagen. Precio: $0.0804 / imagen. Página: gemini-3-pro-image-preview.

4. Nano Banana 2 (Gemini 3.1 Flash Image) — la opción con mejor relación calidad-precio
Es el primero que elijo. Gemini 3.1 Flash Image Preview mantiene un Elo de 1255 — cuarto en la clasificación general, por delante de la mayoría del campo — a $0.0402 por imagen. Esa relación entre calidad clasificada y precio es la mejor de esta lista, y por mucho.
También tiene aquí la ficha técnica más flexible: resoluciones de 0.5K hasta 4K, hasta 14 imágenes de referencia, relaciones de aspecto ultrapanorámicas y ultraverticales (1:4, 4:1, 1:8, 8:1) que ningún otro modelo de esta lista ofrece, y conexión a Google Image Search para temas fácticos.
El límite honesto: en el nivel flash, ocasionalmente obtienes un resultado correcto al 90 % que necesita una segunda pasada, lo que reduce la ventaja de precio en prompts delicados. Para trabajos de gran volumen en los que puedes permitirte un reintento, sigue ganando por coste.
Ideal para: generación de gran volumen, banners y cualquier caso en el que el precio por imagen buena sea la métrica real. Precio: $0.0402 / imagen. Página: gemini-3.1-flash-image-preview.
5. Seedream 5.0 — fotorrealismo en el extremo bajo de la banda de precios
Seedream 5.0 de ByteDance genera por defecto una alta resolución nativa (su configuración de ejemplo funciona a 2227×3183) y apuesta firmemente por el fotorrealismo y la riqueza cultural. A $0.0298 por imagen es uno de los modelos realmente buenos más baratos de esta lista. Las listas occidentales suelen ignorar por completo la línea Seedream; es su pérdida y una brecha que este artículo pretende cerrar.
Hay que conocer dos costes. En cuanto a la integración, Seedream funciona de forma asíncrona: envías un trabajo y consultas el resultado, un paso más que en los modelos síncronos (código abajo). Además, devuelve un campo has_nsfw_contents en cada respuesta, útil para la moderación, pero significa que siempre interviene un filtro de contenido, quieras usarlo o no.
Ideal para: resultados fotorrealistas, escenas para mercados asiáticos y multilingües y generación de gran volumen con costes controlados. Precio: $0.0298 / imagen. Página: seedream-5-0-260128.

6. Wan 2.5 — la opción multilingüe
Wan 2.5 de Alibaba todavía no aparece clasificado individualmente en la Arena, así que no fingiré tener una cifra de calidad que no existe. Lo que ofrece, según su página de modelo, es un interruptor de expansión de prompts y un campo de prompt negativo — controles reales que los modelos insignia cerrados no exponen — además de un sólido tratamiento de prompts multilingües heredado de su linaje Qwen. A $0.027 por imagen, se encuentra cerca del precio mínimo de esta lista.
La contrapartida: pocos análisis comparativos de terceros. Puedo decirte que produjo resultados limpios y controlables con los prompts que probé; todavía no puedo señalar un Elo independiente que lo respalde. Considéralo un modelo utilitario sólido, no un ganador probado de la clasificación.
Ideal para: prompts que no están en inglés, flujos de trabajo que necesitan prompts negativos y generación económica. Precio: $0.027 / imagen. Página: wan-2.5.
7. Kling Image O1 — la opción más barata que no parece barata
A $0.0224 por imagen, Kling Image O1 tiene el precio más bajo de esta lista y se gana su puesto, no se limita a competir rebajando precios. La variante O1 añade razonamiento para gestionar mejor prompts complejos con varios elementos y destaca en iluminación cinematográfica y detalle arquitectónico.
La misma salvedad que con Wan: no está clasificado por separado en la Arena, por lo que la afirmación sobre su calidad se basa en resultados propios y no en una puntuación independiente. En prompts densos — de esos con cinco cláusulas que describen una escena abarrotada — mantuvo una coherencia espacial mejor de lo que esperaba para ese precio.
Ideal para: escenas cinematográficas, prompts densos y presupuestos muy ajustados. Precio: $0.0224 / imagen. Página: kling-image-o1.
Calidad frente a precio, representados
Si comparas entre sí las dos cifras importantes, el campo se ordena solo:
- Máxima calidad, máximo precio: GPT Image 2 (Elo 1339, por consumo) y Nano Banana Pro ($0.0804). Los eliges cuando el resultado es el producto.
- El punto de mejor relación calidad-precio: Nano Banana 2 (Elo 1255 a $0.0402) destaca: calidad clasificada a un precio inferior a $0.05. GPT Image 1.5 (Elo 1265, por consumo) también encaja aquí si mantienes tamaños moderados.
- Precio mínimo, pero todavía capaz: Kling O1 ($0.0224), Wan 2.5 ($0.027) y Seedream 5.0 ($0.0298): todos por debajo de tres centavos, todos suficientemente buenos para ponerlos en producción y ninguno con una puntuación independiente de primer nivel.
Si tuviera que resumirlo en una frase: paga por GPT Image 2 cuando la imagen sea el entregable, usa Nano Banana 2 para todo lo demás y baja a Kling o Seedream cuando las matemáticas del volumen te obliguen.
Política de contenido y moderación: qué permite cada modelo
Este es el criterio que las otras listas no quieren abordar, y es un factor de selección real. Un modelo que rechaza un catálogo de ropa de baño, un anuncio de cerveza o el arte principal de un videojuego de terror es un modelo con el que no puedes trabajar, independientemente de su Elo.
Algunas diferencias concretas que conviene conocer antes de decidir:
- GPT Image aplica moderación obligatoria, y la API directa sitúa a toda la familia detrás de la verificación de la organización. Es el más estricto de los siete con prompts comerciales que se encuentran en el límite.
- Seedream 5.0 devuelve un indicador
has_nsfw_contents en cada respuesta — siempre interviene un filtro de contenido, algo que quizá quieras o debas tener en cuenta en el diseño.
- En todos los modelos de GPT Proto, un prompt bloqueado devuelve un error 503 de política de contenido (el estado subyacente es 400), por lo que puedes capturarlo y redirigirlo correctamente en lugar de adivinar por qué falló un trabajo.
Si tu caso de uso necesita un acceso menos restrictivo y controlado por el desarrollador — el tipo de superficie de API sin censura que a veces requiere el trabajo comercial legítimo relacionado con adultos — debes evaluarlo por modelo según sus condiciones, no esperar que una sola clasificación responda. Para la selección, el punto es más sencillo: el nivel de moderación varía según el modelo y debe formar parte de tu evaluación junto con la calidad y el precio.
¿Cuál deberías utilizar?
- Quieres la mejor imagen y el coste es secundario → GPT Image 2. Acepta la facturación por consumo y la latencia de los prompts complejos.
- Generas a gran escala y la métrica es el precio por imagen buena → Nano Banana 2. La mejor relación de la lista.
- Necesitas resolución 4K o de impresión → Nano Banana Pro.
- Tu presupuesto es limitado, pero no puedes entregar resultados defectuosos → Kling Image O1 o Seedream 5.0.
- Tus prompts no están en inglés o necesitas prompts negativos → Wan 2.5, con Seedream 5.0 como alternativa fotorrealista.
- Quieres resultados de la familia OpenAI sin pagar el precio del modelo insignia → GPT Image 1.5.
Cómo acceder a los siete mediante una sola API
Esta es la parte que hace que «mejor API» sea una pregunta distinta de «mejor modelo». En GPT Proto, estos siete funcionan con la misma clave y los mismos dos endpoints. Cambiar de modelo requiere modificar una sola línea.
La autenticación consiste en incluir la clave de API sin modificaciones en el encabezado Authorization — sin el prefijo Bearer:
Authorization: GPTPROTO_API_KEY
Síncrono (compatible con OpenAI)
El endpoint /v1/images/generations devuelve la imagen en la respuesta. Para cambiar de modelo, modifica la cadena model: esa es toda la migración:
import requests
import base64
resp = requests.post(
"https://gptproto.com/v1/images/generations",
headers={
"Authorization": "GPTPROTO_API_KEY",
"Content-Type": "application/json",
},
json={
"model": "gemini-3.1-flash-image-preview", # swap to "gpt-image-2", "gemini-3-pro-image-preview", ...
"prompt": "An editorial product photo of a matte black camera on red lacquer",
"size": "16:9",
},
)
data = resp.json()
b64 = data["data"][0]["b64_json"]
with open("output.png", "wb") as f:
f.write(base64.b64decode(b64))
La respuesta también incluye un objeto usage con los recuentos de tokens, que permite conciliar el gasto de los modelos GPT Image facturados por consumo. La gestión del tamaño varía según el modelo — la línea Gemini acepta relaciones de aspecto como 16:9, mientras que GPT Image acepta tamaños en píxeles — así que consulta la página del modelo de destino al cambiar.
Asíncrono (enviar y consultar)
Los modelos del linaje de ByteDance, como Seedream 5.0, funcionan mediante la ruta /api/v3/: envías un trabajo, recibes un id y consultas el resultado.
import requests
import time
submit = requests.post(
"https://gptproto.com/api/v3/bytedance/seedream-5-0-260128/text-to-image",
headers={
"Authorization": "GPTPROTO_API_KEY",
"Content-Type": "application/json",
},
json={
"prompt": "Cute character wallpaper for a phone lock screen, soft studio lighting",
"size": "2227*3183",
"enable_sync_mode": False,
},
).json()
get_url = submit["data"]["urls"]["get"]
while True:
result = requests.get(
get_url,
headers={"Authorization": "GPTPROTO_API_KEY"},
).json()
if result["data"]["status"] == "completed":
print(result["data"]["outputs"])
break
time.sleep(2)
Errores que realmente encontrarás
| Código |
Significado |
Qué hacer |
| 401 |
Falta la clave de API o no es válida |
Comprueba el encabezado Authorization
|
| 403 |
Sin acceso o saldo insuficiente |
Añade créditos o comprueba el alcance de la clave |
| 429 |
Límite de solicitudes superado |
Espera y vuelve a intentarlo |
| 503 |
Bloqueo por política de contenido (400 subyacente) |
Captúralo; redirige o reformula el prompt |
Matriz de capacidades de Gemini (según la documentación)
| Función |
Gemini 2.5 Flash |
Gemini 3.1 Flash (Nano Banana 2) |
Gemini 3 Pro (Nano Banana Pro) |
| Resoluciones |
1K |
0.5K, 1K, 2K, 4K |
1K, 2K, 4K |
| Máximo de imágenes de referencia |
3 |
14 |
14 |
| Relaciones ultrapanorámicas |
— |
1:4, 4:1, 1:8, 8:1 |
— |
| Conexión a búsqueda de imágenes |
— |
sí |
— |
Esa historia de migración — cambiar una cadena, conservar tu cliente y recurrir a otros proveedores cuando uno deja de funcionar — es la verdadera razón para utilizar modelos de imágenes mediante un agregador en lugar de conectar cuatro SDK. Empieza por el catálogo de modelos y la página de inicio de GPT Proto para consultar el conjunto completo.
Los precios y las clasificaciones de la Arena reflejan las páginas activas de los modelos y Artificial Analysis Image Arena en el momento de la redacción. Ambos cambian con frecuencia — consulta las páginas de los modelos enlazadas antes de elaborar tu presupuesto.