Comment j’ai établi le classement
Trois critères, dans cet ordre.
Qualité — score Elo de l’Artificial Analysis Image Arena, où les utilisateurs choisissent entre deux images générées à partir du même prompt sans savoir quel modèle a produit chacune. C’est le signal le moins facile à manipuler dont nous disposons. Une réserve importante, toutefois : l’Elo mesure la préférence humaine moyenne, et non la performance pour votre tâche spécifique. Un modèle qui excelle dans les portraits peut échouer avec la typographie.
Prix — relevé sur la page GPT Proto en ligne de chaque modèle le jour de la rédaction. Les API d’images changent souvent de prix ; consultez la page avant d’engager un budget sur la base d’un chiffre lu dans un article de blog.
Intégration — authentification, fonctionnement synchrone ou asynchrone, gestion des erreurs. C’est la partie que la plupart des listes ignorent et à laquelle vous êtes confronté dès le premier jour.
C’est mon cadre d’analyse, pas une vérité absolue. Si votre seul critère est « les pixels les moins chers qui ne semblent pas défectueux », allez directement au bas du tableau.
La comparaison en un coup d’œil
| Modèle |
Fournisseur |
Elo de l’Arena |
Prix GPT Proto |
Facturation |
Idéal pour |
| GPT Image 2 |
OpenAI |
1339 |
$6.4 / $24 par million de tokens |
à la consommation |
Qualité haut de gamme, rendu du texte |
| GPT Image 1.5 |
OpenAI |
1265 |
$5.6 / $22.4 par million de tokens |
à la consommation |
Presque le niveau phare, option GPT moins chère |
| Nano Banana Pro (Gemini 3 Pro Image) |
Google |
niveau supérieur* |
$0.0804 / image |
par image |
Ressources professionnelles en 4K |
| Nano Banana 2 (Gemini 3.1 Flash Image) |
Google |
1255 |
$0.0402 / image |
par image |
Gros volumes, meilleur rapport qualité-prix |
| Seedream 5.0 |
ByteDance |
niveau 9* |
$0.0298 / image |
par image |
Photoréalisme, haute résolution native |
| Wan 2.5 |
Alibaba |
pas encore classé |
$0.027 / image |
par image |
Prompts multilingues, prompts négatifs |
| Kling Image O1 |
Kling |
pas encore classé |
$0.0224 / image |
par image |
Le moins cher utilisable, détails cinématographiques |
* Nano Banana Pro et Seedream 5.0 ne figuraient pas comme entrées individuelles dans le classement de l’Arena au moment de la rédaction ; leurs modèles frères et prédécesseurs se trouvent dans le niveau supérieur. Je l’ai signalé plutôt que d’attribuer un chiffre qui ne leur appartient pas.
Deux colonnes de ce tableau fonctionnent réellement, contrairement à ce que négligent les autres listes. La facturation distingue clairement les modèles : GPT Image facture au token, de sorte que le coût d’une seule image varie selon sa taille et sa qualité, ce qui le rend véritablement difficile à prévoir à grande échelle. Les cinq autres appliquent un tarif fixe par image — peu passionnant, mais exactement ce que veut votre équipe financière. Tous les prix GPT Proto ci-dessus sont également inférieurs au tarif de référence du marché du modèle ; pour une fois, les chiffres justifient l’affirmation « moins cher » plutôt qu’un simple slogan.
Les sept modèles
1. GPT Image 2 — le modèle à battre
GPT Image 2 domine l’Artificial Analysis Text-to-Image Arena avec un Elo de 1339 sur environ 11 480 comparaisons à l’aveugle. Ce n’est pas une avance marginale. Il se situe confortablement au-dessus du reste du classement, notamment grâce à son rendu du texte et à son respect des instructions. OpenAI l’a lancé le 21 avril 2026.
Le coût de cette qualité est bien réel, à deux égards. Premièrement, la facturation est à la consommation, à $6.4 par million de tokens d’entrée et $24 par million de tokens de sortie sur GPT Proto. Une image 1024×1024 de haute qualité coûte donc plus cher qu’une ébauche rapide, et vos dépenses par image évoluent à chaque changement de taille ou de qualité. Deuxièmement, les prompts complexes peuvent prendre jusqu’à deux minutes avant de renvoyer un résultat — acceptable pour un traitement par lots, mais pénible derrière un bouton fixé par un utilisateur qui attend.
Un point de friction disparaît toutefois ici. En accès direct, la famille GPT Image nécessite la vérification de l’organisation de l’API OpenAI avant le premier appel. Avec GPT Proto, vous vous authentifiez à l’aide de la clé de la plateforme et ignorez entièrement cette étape.
Idéal pour : l’image principale, l’affiche de campagne, tout ce où un excellent résultat vaut mieux que dix résultats bon marché. Prix : $6.4 / $24 par million de tokens. Page : gpt-image-2.

2. GPT Image 1.5 — presque la même qualité, pour une facture moindre
GPT Image 1.5 affiche un Elo de 1265, deuxième du classement et proche de son successeur. Sur GPT Proto, il coûte $5.6 / $22.4 par million de tokens — moins cher que GPT Image 2 sur les deux postes. Si vous utilisez déjà l’écosystème d’images OpenAI et n’avez pas besoin d’être absolument au sommet du classement, c’est le choix pragmatique.
Le revers : le modèle de facturation à la consommation est identique, avec la même imprévisibilité budgétaire. Vous échangez un peu de qualité contre une légère économie, sans échapper à la facturation au token.
Idéal pour : les équipes qui veulent les résultats et la cohérence de la famille GPT sans le prix du modèle phare. Prix : $5.6 / $22.4 par million de tokens. Page : gpt-image-1.5.
3. Nano Banana Pro (Gemini 3 Pro Image) — le spécialiste de la 4K
Gemini 3 Pro Image Preview de Google — le modèle que la communauté appelle Nano Banana Pro — est conçu pour la production de ressources professionnelles, avec un raisonnement adapté aux compositions complexes. Il génère en 1K, 2K et 4K, accepte jusqu’à 14 images de référence et, dans les prompts que j’ai testés, conservait les détails de la peau, des cheveux et de l’éclairage que les modèles de niveau Flash estompent à fort zoom.
C’est le plus cher des deux modèles Gemini, à $0.0804 par image — environ deux fois le prix de Nano Banana 2. Vous payez le plafond de résolution et le raisonnement. Pour une miniature ou une publication sociale, vous payez trop cher ; pour un visuel clé destiné à l’impression, ce n’est pas le cas.
Idéal pour : les sorties en 4K, l’impression, tout ce que vous allez agrandir et examiner. Prix : $0.0804 / image. Page : gemini-3-pro-image-preview.

4. Nano Banana 2 (Gemini 3.1 Flash Image) — le meilleur rapport qualité-prix
C’est celui que j’utilise en premier. Gemini 3.1 Flash Image Preview affiche un Elo de 1255 — quatrième au classement général, devant la plupart des autres modèles — pour $0.0402 par image. Le rapport entre qualité classée et prix est le meilleur de cette liste, et de loin.
Sa fiche technique est également la plus flexible : résolutions de 0.5K à 4K, jusqu’à 14 images de référence, rapports ultra-larges et ultra-verticaux (1:4, 4:1, 1:8, 8:1) que les autres modèles de cette liste ne proposent pas, ainsi qu’un ancrage Google Image Search pour les sujets factuels.
La limite à reconnaître : au niveau Flash, il arrive que le résultat soit correct à 90 % et nécessite une seconde passe, ce qui réduit l’avantage tarifaire pour les prompts délicats. Pour les tâches à gros volume où vous pouvez vous permettre une nouvelle tentative, il reste le meilleur choix économique.
Idéal pour : la génération en gros volume, les bannières, tout ce où le véritable indicateur est le prix par bonne image. Prix : $0.0402 / image. Page : gemini-3.1-flash-image-preview.
5. Seedream 5.0 — photoréaliste dans le bas de la fourchette de prix
Seedream 5.0 de ByteDance génère par défaut une haute résolution native (sa configuration d’exemple utilise 2227×3183) et mise fortement sur le photoréalisme et la nuance culturelle. À $0.0298 par image, c’est l’un des modèles véritablement performants les moins chers de cette sélection. Les listes occidentales ont tendance à ignorer complètement la gamme Seedream ; c’est leur perte, et c’est précisément la lacune que cet article cherche à combler.
Deux coûts sont à connaître. Côté intégration, Seedream fonctionne de manière asynchrone : vous envoyez une tâche et interrogez ensuite le résultat, soit une étape de plus que pour les modèles synchrones (voir le code ci-dessous). Chaque réponse contient également un champ has_nsfw_contents, utile pour la modération, mais qui signifie qu’un filtre de contenu intervient systématiquement, que vous le souhaitiez ou non.
Idéal pour : les sorties photoréalistes, les scènes destinées aux marchés asiatiques et multilingues, la génération en volume à budget maîtrisé. Prix : $0.0298 / image. Page : seedream-5-0-260128.

6. Wan 2.5 — l’option multilingue
Wan 2.5 d’Alibaba n’est pas encore classé individuellement dans l’Arena ; je ne vais donc pas lui attribuer un score de qualité qu’il n’a pas. D’après sa page de modèle, il propose une option d’extension du prompt et un champ de prompt négatif — de véritables contrôles que les modèles phares propriétaires n’exposent pas — ainsi qu’une excellente gestion des prompts multilingues issue de sa lignée Qwen. À $0.027 par image, il se situe près du prix plancher de cette liste.
Le compromis : peu de tests comparatifs indépendants. Je peux vous dire qu’il a produit des sorties propres et contrôlables avec les prompts que j’ai essayés ; je ne peux pas encore m’appuyer sur un Elo indépendant. Considérez-le comme un modèle utilitaire solide, et non comme un champion confirmé du classement.
Idéal pour : les prompts non anglophones, les flux de travail nécessitant des prompts négatifs, la génération à petit budget. Prix : $0.027 / image. Page : wan-2.5.
7. Kling Image O1 — le moins cher qui ne fasse pas bon marché
À $0.0224 par image, Kling Image O1 est le modèle le moins cher de cette liste, et il mérite sa place autrement qu’en cassant simplement les prix. La variante O1 ajoute un raisonnement qui améliore la gestion des prompts complexes à plusieurs éléments, et elle est performante pour l’éclairage cinématographique et les détails architecturaux.
Même réserve que pour Wan : il n’est pas classé séparément dans l’Arena, et l’affirmation concernant sa qualité repose donc sur des résultats observés directement plutôt que sur un score indépendant. Avec des prompts denses — par exemple cinq propositions décrivant une scène encombrée — il a mieux conservé la cohérence spatiale que je ne l’aurais pensé à ce prix.
Idéal pour : les scènes cinématographiques, les prompts denses, les budgets très serrés. Prix : $0.0224 / image. Page : kling-image-o1.
Qualité et prix, en graphique
Mettez en regard les deux chiffres qui comptent et le classement devient évident :
Qualité et prix élevés : GPT Image 2 (Elo 1339, à la consommation) et Nano Banana Pro ($0.0804). Vous les choisissez lorsque la sortie constitue le produit.
Le meilleur rapport qualité-prix : Nano Banana 2 (Elo 1255 à $0.0402) se démarque nettement — une qualité classée à moins de $0.05. GPT Image 1.5 (Elo 1265, à la consommation) se retrouve également dans cette zone si vos tailles restent modestes.
Le plancher budgétaire, mais toujours performant : Kling O1 ($0.0224), Wan 2.5 ($0.027), Seedream 5.0 ($0.0298) — tous sous les trois centimes, tous assez bons pour être mis en production, mais aucun ne disposant d’un score indépendant dans le niveau supérieur.
Si je devais résumer en une phrase : payez pour GPT Image 2 lorsque l’image est le livrable, utilisez Nano Banana 2 pour tout le reste, puis passez à Kling ou Seedream lorsque les calculs de volume l’exigent.
Politique de contenu et modération : ce que chaque modèle autorise
C’est l’axe que les autres listes évitent, alors qu’il s’agit d’un véritable facteur de sélection. Un modèle qui refuse un catalogue de maillots de bain, une publicité pour de la bière ou le visuel principal d’un jeu d’horreur est un modèle avec lequel vous ne pouvez pas mettre votre produit en production, quel que soit son Elo.
Voici quelques différences concrètes à connaître avant de vous engager :
GPT Image applique une modération obligatoire, et l’API directe protège toute la famille derrière une vérification de l’organisation. C’est le plus strict des sept modèles pour les prompts commerciaux à la limite des règles.
Seedream 5.0 renvoie un indicateur has_nsfw_contents dans chaque réponse — un filtre de contenu intervient toujours, ce dont vous pouvez avoir besoin ou dont vous devrez tenir compte dans votre conception.
Pour tous les modèles sur GPT Proto, un prompt bloqué renvoie une erreur de politique de contenu 503 (le statut sous-jacent est 400), ce qui vous permet de l’intercepter et de le rediriger proprement au lieu de deviner pourquoi une tâche a échoué.
Si votre cas d’usage nécessite un accès moins restrictif et contrôlé par le développeur — le type d’interface API non censurée parfois requis par certains travaux commerciaux légitimes liés aux adultes — cette question doit être évaluée modèle par modèle au regard de leurs conditions, et non résolue par un classement unique. Pour la sélection, le principe est plus simple : le niveau de modération varie selon le modèle et doit être évalué au même titre que la qualité et le prix.
Lequel utiliser ?
Vous voulez la meilleure image et le coût est secondaire → GPT Image 2. Acceptez la facturation à la consommation et la latence des prompts complexes.
Vous générez en volume et le prix par bonne image est votre indicateur → Nano Banana 2. Le meilleur rapport de la liste.
Vous avez besoin de 4K ou d’une résolution d’impression → Nano Banana Pro.
Votre budget est limité, mais vous ne pouvez pas mettre en production une sortie défectueuse → Kling Image O1 ou Seedream 5.0.
Vos prompts ne sont pas en anglais ou vous avez besoin de prompts négatifs → Wan 2.5, avec Seedream 5.0 comme alternative photoréaliste.
Vous voulez une sortie de la famille OpenAI sans le prix du modèle phare → GPT Image 1.5.
Comment accéder aux sept modèles via une seule API
Voici ce qui distingue la question de la « meilleure API » de celle du « meilleur modèle ». Sur GPT Proto, ces sept modèles utilisent la même clé et les mêmes deux endpoints. Changer de modèle ne demande qu’une seule modification de ligne.
L’authentification utilise directement la clé API dans l’en-tête Authorization — sans préfixe Bearer :
Authorization: GPTPROTO_API_KEY
Synchrone (compatible avec OpenAI)
L’endpoint /v1/images/generations renvoie l’image dans la réponse. Pour changer de modèle, modifiez la chaîne model — c’est toute la migration :
import requests
import base64
resp = requests.post(
"https://gptproto.com/v1/images/generations",
headers={
"Authorization": "GPTPROTO_API_KEY",
"Content-Type": "application/json",
},
json={
"model": "gemini-3.1-flash-image-preview", # swap to "gpt-image-2", "gemini-3-pro-image-preview", ...
"prompt": "An editorial product photo of a matte black camera on red lacquer",
"size": "16:9",
},
)
data = resp.json()
b64 = data["data"][0]["b64_json"]
with open("output.png", "wb") as f:
f.write(base64.b64decode(b64))
La réponse contient également un objet usage avec le nombre de tokens, ce qui permet de rapprocher les dépenses pour les modèles GPT Image facturés à la consommation. La gestion de la taille varie selon le modèle — la gamme Gemini accepte des rapports comme 16:9, tandis que GPT Image utilise des dimensions en pixels — consultez donc la page du modèle cible lorsque vous changez de modèle.
Asynchrone (soumettre et interroger)
Les modèles issus de la lignée ByteDance, comme Seedream 5.0, utilisent le chemin /api/v3/ : vous soumettez une tâche, recevez un id, puis interrogez le résultat.
import requests
import time
submit = requests.post(
"https://gptproto.com/api/v3/bytedance/seedream-5-0-260128/text-to-image",
headers={
"Authorization": "GPTPROTO_API_KEY",
"Content-Type": "application/json",
},
json={
"prompt": "Cute character wallpaper for a phone lock screen, soft studio lighting",
"size": "2227*3183",
"enable_sync_mode": False,
},
).json()
get_url = submit["data"]["urls"]["get"]
while True:
result = requests.get(
get_url,
headers={"Authorization": "GPTPROTO_API_KEY"},
).json()
if result["data"]["status"] == "completed":
print(result["data"]["outputs"])
break
time.sleep(2)
Les erreurs que vous rencontrerez réellement
| Code |
Signification |
Action à effectuer |
| 401 |
Clé API absente ou invalide |
Vérifiez l’en-tête Authorization
|
403|
|
Aucun accès ou solde insuffisant |
Ajoutez des crédits ou vérifiez la portée de la clé |
| 429 |
Limite de débit dépassée |
Attendez, puis réessayez |
| 503 |
Blocage lié à la politique de contenu (400 sous-jacent) |
Interceptez l’erreur, redirigez ou reformulez le prompt |
Matrice des capacités de Gemini (d’après la documentation)
| Fonctionnalité |
Gemini 2.5 Flash |
Gemini 3.1 Flash (Nano Banana 2) |
Gemini 3 Pro (Nano Banana Pro) |
| Résolutions |
1K |
0.5K, 1K, 2K, 4K |
1K, 2K, 4K |
| Nombre maximal d’images de référence |
3 |
14 |
14 |
| Rapports ultra-larges |
— |
1:4, 4:1, 1:8, 8:1 |
— |
| Ancrage par recherche d’images |
— |
oui |
— |
Cette possibilité de changer une chaîne, de conserver son client et de basculer entre les fournisseurs lorsque l’un d’eux est indisponible constitue la véritable raison d’appeler les modèles d’images via un agrégateur plutôt que d’intégrer quatre SDK. Commencez par le catalogue de modèles et la page d’accueil GPT Proto pour consulter l’ensemble des modèles.
Les prix et les classements de l’Arena reflètent les pages de modèles en ligne et l’Artificial Analysis Image Arena au moment de la rédaction. Tous deux changent fréquemment : consultez les pages des modèles concernés avant d’établir votre budget.