GPT 2.5 vs GPT 2.0: O que você está realmente comparando?
GPT Image 2.5 introduz duas opções de API em vez de uma. GPT Image 2.5 Flare aceita entradas de texto e imagem e é descrito pela OpenAI como o modelo mais rápido da família para geração cotidiana de alta qualidade. GPT Image 2.5 Sunburst aceita os mesmos tipos de entrada, mas é posicionado para tarefas em que a precisão de edição é prioridade.
GPT Image 2 também oferece suporte a geração e edição a partir de entradas de texto e imagem. Ele continua sendo uma linha de base válida, não um modelo legado quebrado ou inutilizável. A desvantagem é que ele não expõe as configurações de qualidade xhigh e max disponíveis na família 2.5.
| Especificação |
GPT Image 2 |
GPT Image 2.5 Flare |
GPT Image 2.5 Sunburst |
| ID do modelo |
gpt-image-2 |
gpt-image-2.5-flare |
gpt-image-2.5-sunburst |
| Função oficial |
Modelo anterior de geração e edição geral |
Geração cotidiana rápida |
Geração e edição com foco em precisão |
| Entradas |
Texto e imagem |
Texto e imagem |
Texto e imagem |
| Saída |
Imagem |
Imagem |
Imagem |
| Configurações de qualidade compartilhadas |
auto, low, medium, high |
auto, low, medium, high |
auto, low, medium, high |
| Configurações adicionais |
Nenhuma |
xhigh, max |
xhigh, max |
| Configuração justa de comparação direta |
high |
high |
high |
Esta comparação de API também deve ser mantida separada dos recursos de produto do ChatGPT. Sketch, modelos, comentários e compartilhamento de prompts podem mudar como as pessoas criam imagens dentro do ChatGPT, mas não dizem a um desenvolvedor de API qual modelo deve lidar com a edição de uma foto de produto ou um lote de criativos de anúncios. Para as mudanças no nível do produto, consulte O que é ChatGPT Images 2.5?.
Como testamos GPT Image 2.5 e GPT Image 2 com os mesmos prompts
Uma comparação com o mesmo prompt só é útil quando as outras variáveis importantes permanecem fixas. Se o GPT Image 2 roda em high enquanto o Sunburst roda em max, o resultado mede duas configurações de qualidade, além de dois modelos. Se um modelo tem cinco tentativas e outro tem uma, a comparação mede seleção seletiva.
Para o teste principal, use estes controles:
Tamanho: 1024x1024
Qualidade: high
Formato de saída: PNG
Prompt: texto idêntico, incluindo pontuação
Entrada de referência: o mesmo arquivo de origem para todas as execuções de edição
Tentativas: mantenha o primeiro resultado concluído de cada modelo
Falhas: registre recusas, timeouts e saídas inutilizáveis em vez de executá-las novamente em silêncio
O guia de geração de imagens da OpenAI confirma que high está disponível nos três modelos. Ele também afirma que dimensões personalizadas devem usar valores de largura e altura divisíveis por 16, ficar entre 1:3 e 3:1 e permanecer dentro dos limites de pixels documentados. Esses tamanhos extras são úteis em produção, mas um teste quadrado de 1024 pixels é mais fácil de reproduzir.
Cada saída deve ser pontuada antes de olhar o nome do modelo. Uma revisão cega é melhor se houver mais de uma pessoa disponível.
| Métrica |
Medição |
| Aderência ao prompt |
Pontuação de 0 a 5 em relação a uma lista de verificação escrita |
| Precisão do texto |
Caracteres solicitados corretos divididos pelo total de caracteres solicitados |
| Localidade da edição |
Se alguma área protegida foi alterada |
| Preservação da referência |
Pontuação de 0 a 5 para sujeito, forma, identidade e composição |
| Latência |
Segundos desde o envio da solicitação até a saída concluída |
| Contagem de tentativas |
Chamadas adicionais necessárias para uma imagem aceitável |
| Custo real |
Valor cobrado pela chamada concluída, incluindo entradas e saída |
| Utilizável na primeira passagem |
Sim ou não em relação a uma regra de aceitação predefinida |
Não combine essas medições em uma única pontuação vaga de “parece melhor”. Uma imagem polida ainda pode falhar porque escreve errado o nome do produto. Uma edição fiel pode ser visualmente menos dramática e ainda assim ser o melhor resultado de API.
Teste 1: Seguimento de prompt de texto para imagem
O primeiro teste verifica se cada modelo segue um briefing contendo contagem, posição, cor, texto e restrições negativas. Ele se aproxima intencionalmente mais de uma solicitação de ecommerce do que de um prompt artístico livre.
Use este prompt sem alterações:
Crie uma fotografia editorial quadrada de produto para uma marca fictícia de água com gás. Coloque exatamente três latas finas de alumínio sobre um pedestal coral claro: uma lata amarelo-limão no centro, uma lata verde-menta à esquerda e uma lata azul-céu à direita. Imprima o nome da marca "MORI FIZZ" uma vez em cada lata. Adicione dois limões fatiados ao lado do pedestal, não em cima dele. Use um fundo creme quente, sombras suaves de tarde e um visual de fotografia de estúdio com lente de 50 mm. Sem pessoas, sem latas extras, sem frutas flutuando, sem texto duplicado e sem borda.
Este prompt cria uma lista de verificação objetiva: três latas, três cores especificadas, posições fixas, um nome de marca em cada lata, duas fatias de limão e nenhuma adição proibida. O gosto visual ainda importa, mas não decide mais o resultado inteiro.

| Modelo |
Contagem de objetos |
Cor e posição |
Texto da marca |
Restrições negativas |
Qualidade visual |
Utilizável na primeira passagem |
| GPT Image 2 |
3/3 latas; 2/2 metades de limão |
Todas as três latas corretas |
“MORI FIZZ” correto uma vez por lata |
Aprovado; sem objetos extras ou texto repetido |
4,6/5 — limpo e equilibrado, embora um pouco mais renderizado do que fotografado |
Sim |
| Flare |
3/3 latas; 2/2 metades de limão |
Todas as três latas corretas |
Marca principal correta uma vez por lata |
Falha parcial; adicionou sabor repetido, “SPARKLING WATER” e “330 mL” |
4,8/5 — os rótulos em estilo varejo mais detalhados e condensação convincente |
Não segundo o briefing estrito |
| Sunburst |
3/3 latas; 2/2 metades de limão |
Todas as três latas corretas |
“MORI FIZZ” correto uma vez por lata |
Aprovado nas regras de texto e objeto; adicionou ilustrações de rótulo sem texto |
4,9/5 — o melhor detalhe de material, iluminação e acabamento premium do produto |
Sim |
GPT Image 2 venceu a aderência estrita ao prompt. Ele completou a contagem, o arranjo, as cores e o texto da marca solicitados sem introduzir texto extra no rótulo. Sunburst produziu a imagem final com melhor aparência e ainda passou nas restrições explícitas, mas suas grandes ilustrações botânicas e de frutas foram além do briefing solicitado. Flare pareceu altamente utilizável como conceito de embalagem de varejo, porém o texto repetido não solicitado importa porque o prompt dizia explicitamente “sem texto duplicado”.
O resultado prático não é “o modelo mais antigo é melhor”. É mais restrito: neste primeiro prompt, o GPT Image 2 seguiu o briefing literal mais de perto, enquanto o Sunburst produziu o melhor acabamento visual. O Flare precisa de uma instrução mais estrita de “nenhuma outra palavra em lugar algum” ou de uma nova tentativa antes de passar na mesma regra de aceitação.
Teste 2: Renderização de texto e layout
O próximo prompt isola uma falha frequente de produção: uma imagem pode parecer finalizada enquanto as palavras estão erradas. Isso importa para anúncios de produto, miniaturas, pôsteres de eventos, gráficos de menu e mockups de interface.
Crie um anúncio quadrado de ecommerce com um tênis branco de corrida sobre um fundo azul-marinho escuro. Use este texto exato e nenhum outro texto:
NIGHT RUN
LIGHT ON YOUR FEET
$89
SHOP NOW
Coloque NIGHT RUN no topo, LIGHT ON YOUR FEET diretamente abaixo, $89 no canto inferior esquerdo e SHOP NOW dentro de um botão coral arredondado no canto inferior direito. Mantenha cada palavra totalmente visível e escrita corretamente. Não coloque texto no tênis.
Conte primeiro os erros exatos de caracteres. Depois revise posicionamento, hierarquia e legibilidade. Essa ordem impede que um layout visualmente agradável esconda uma falha de ortografia.

| Modelo |
Texto exato correto |
Posicionamento correto |
Texto extra |
Legível na largura do artigo |
Veredito |
| GPT Image 2 |
4/4 textos exatos |
Todos os quatro posicionamentos corretos; sem texto no tênis |
Nenhum |
Sim |
Aprovado — melhor hierarquia e equilíbrio geral |
| Flare |
4/4 textos exatos |
Todos os quatro posicionamentos corretos; sem texto no tênis |
Nenhum |
Sim |
Aprovado — textura de tênis mais nítida, mas a composição fica mais próxima das bordas |
| Sunburst |
4/4 textos exatos |
Todos os quatro posicionamentos corretos; sem texto no tênis |
Nenhum |
Sim |
Aprovado — espaçamento limpo e ângulo de produto convincente; o subtítulo é um pouco menor |
Esta rodada terminou em empate objetivo na precisão de texto: todos os três modelos reproduziram NIGHT RUN, LIGHT ON YOUR FEET, $89 e SHOP NOW sem erros de ortografia, texto extra ou texto no tênis. Cada um também colocou o preço no canto inferior esquerdo e o botão coral no canto inferior direito.
GPT Image 2 recebe uma leve preferência de layout porque sua manchete, subtítulo, produto, preço e botão formam a sequência de leitura mais clara sem lotar o quadro. Flare renderiza uma textura de tênis especialmente nítida, enquanto Sunburst dá ao produto mais iluminação dimensional e espaço para respirar. Essas são preferências de design, não falhas de texto. Na capacidade testada, todos os três passaram.
A OpenAI diz que a renderização de texto melhorou, mas sua própria documentação ainda avisa que posicionamento preciso e clareza do texto podem falhar. Este prompt bem-sucedido mostra que todos os três modelos podem produzir um anúncio limpo e com muito texto; ele não estabelece uma taxa de sucesso de 100% em diferentes textos ou layouts.
Teste 3: Edição de imagem e preservação do sujeito
Para edição de imagem, julgar apenas a mudança solicitada é generoso demais. A pergunta mais útil é se o modelo consegue fazer essa mudança sem reescrever o resto da imagem.
Use uma fotografia original do produto para todas as três chamadas e envie esta instrução:
Altere apenas o rótulo da garrafa de azul para vermelho. Preserve a forma exata da garrafa, a tampa, o logotipo, o texto impresso, a cor do líquido, os reflexos, as sombras, o ângulo da câmera, o corte, a superfície e o fundo. Não adicione, remova, redimensione ou reposicione nada. Retorne um PNG quadrado.

Há uma ressalva importante de design de teste. A imagem de origem é 1080×1350, enquanto todas as três saídas editadas são 1254×1254. Pedir ao modelo para “preservar o corte” e “retornar um PNG quadrado” criou requisitos incompatíveis. Esta rodada pode comparar a preservação relativa entre os três modelos, mas não pode sustentar uma afirmação limpa de localidade de pixels. Uma nova execução mais estrita deveria dizer: Preserve as dimensões e a proporção originais. Retorne PNG.
Amplie o rótulo, a borda da garrafa, o logotipo, os reflexos e o fundo. Uma edição bem-sucedida muda a cor do rótulo enquanto deixa os pixels protegidos visualmente estáveis. Se o logotipo for redesenhado, a garrafa ficar mais larga ou a sombra se mover, registre o desvio mesmo que a nova imagem pareça boa.
| Modelo |
Mudança solicitada concluída |
Marca nominativa e texto impresso |
Forma e ângulo da garrafa |
Preservação de iluminação/fundo |
Veredito de localidade estrita |
| GPT Image 2 |
Sim; rótulo mudou de azul-arroxeado para vermelho |
Majoritariamente retido, mas a tipografia do rótulo e pequenos detalhes do selo foram visivelmente regenerados |
Forma ampla e ângulo retidos |
Reenquadramento perceptível e mudanças na posição das flores e nos reflexos do rótulo |
Falha — edição correta, mas redesenho colateral demais |
| Flare |
Sim; rótulo mudou para vermelho |
Texto principal retido; arte central do rótulo e texto pequeno mudaram |
Forma, tampa, cor do líquido e ângulo permaneceram próximos |
Melhor preservação geral, mas o reenquadramento quadrado e vários detalhes decorativos mudaram |
Falha sob uma regra literal de “alterar apenas” |
| Sunburst |
Sim; rótulo mudou para vermelho |
Texto principal e identidade visual retidos mais de perto; detalhes finos do rótulo ainda mudaram |
Preservação geral mais próxima da garrafa, tampa, líquido e ângulo da câmera |
Correspondência relativa mais forte em composição, cor e reflexos; ainda não é local por pixel |
Melhor dos três, mas não uma aprovação estrita |
Sunburst venceu este teste de preservação relativa. Ele manteve a geometria da garrafa, a tampa verde, o líquido ciano, o ângulo da câmera e a composição floral ao redor mais próximos da origem enquanto fazia a mudança de cor solicitada. Flare veio logo atrás, embora sua arte de rótulo e texto fino tenham sido mais visivelmente redesenhados. GPT Image 2 concluiu a edição solicitada, mas introduziu as mudanças colaterais mais perceptíveis no rótulo e na composição ao redor.
Nenhum dos três produziu uma edição literal apenas de cor. Todos regeneraram pelo menos parte do design do rótulo, e todos transformaram a origem em retrato em uma tela quadrada. Para uma variação casual de campanha, cada saída pode ser utilizável. Para aprovação de embalagem, texto legal ou edição de produto sensível a pixels, todos os três exigem outra passagem — e o próprio benchmark deve ser executado novamente sem a instrução contraditória de saída quadrada.
Teste 4: Edição em múltiplas rodadas e desvio visual
Um modelo pode passar em uma edição e ainda falhar em um fluxo de trabalho real. Cada acompanhamento lhe dá outra chance de alterar detalhes que o usuário queria preservar.
Começando pela imagem original do produto, aplique estas edições em ordem:
Altere apenas o rótulo de azul para vermelho.
Adicione uma pequena estrela dourada acima do logotipo. Preserve o rótulo vermelho concluído e todo o resto.
Substitua apenas o fundo por papel bege quente. Preserve a garrafa, o rótulo vermelho, o logotipo, a estrela dourada, a direção da iluminação e o corte.

| Modelo |
Rodada 1: rótulo vermelho |
Rodada 2: estrela dourada |
Rodada 3: papel bege |
Edições anteriores retidas |
Veredito multirodada |
| GPT Image 2 |
Concluído, com o maior redesenho colateral na primeira edição |
Aprovado; adicionou uma estrela dourada acima da marca nominativa principal e manteve o rótulo vermelho |
Aprovado; mudou o fundo ciano para bege quente texturizado e manteve a estrela |
Sim; ambas as edições solicitadas sobreviveram até a imagem final |
Utilizável nas três rodadas, mas arte do rótulo, pequenos detalhes e flores ao redor mostraram a maior regeneração cumulativa |
| Flare |
Concluído, com redesenho moderado na primeira edição |
Aprovado; adicionou uma pequena estrela e produziu a continuação visual mais próxima de seu quadro anterior |
Aprovado; substituiu o fundo mantendo a estrela, o rótulo vermelho, a pose da garrafa e a direção da iluminação |
Sim; o estado anterior permaneceu o mais estável de rodada para rodada |
Melhor consistência multirodada nesta sequência |
| Sunburst |
Melhor preservação relativa na primeira edição |
Aprovado; adicionou uma estrela dourada centralizada e manteve o rótulo vermelho e a composição |
Aprovado; produziu um fundo de papel quente convincente e manteve ambas as edições anteriores |
Sim; geometria central e identidade permaneceram próximas, com pequenas mudanças de tom e detalhes florais finos |
Forte segundo lugar em consistência cumulativa; melhor na edição inicial que preserva a origem |
Todos os três modelos concluíram as duas instruções de acompanhamento no primeiro resultado fornecido: cada um adicionou exatamente uma estrela e depois substituiu o fundo preservando o rótulo vermelho e a estrela. Este é um resultado mais forte do que o desfecho de localidade estrita do Teste 3, porque o benchmark agora pergunta se o estado semântico anterior sobrevive — não se cada pixel protegido permanece inalterado.
Flare venceu a cadeia completa de edição. Sua posição da estrela, layout do rótulo, ângulo da garrafa, flores em primeiro plano e direção do destaque permaneceram os mais estáveis entre as rodadas 2 e 3. Sunburst foi o melhor resultado de edição única na Rodada 1, mas Flare acumulou menos desvio adicional nas duas instruções seguintes. GPT Image 2 também preservou ambas as edições anteriores, embora mais da arte do rótulo e da composição ao redor parecessem regeneradas, e seu fundo final pendeu mais para dourado do que os outros dois tratamentos de papel bege quente.
A OpenAI lista a consistência multirodada melhorada como parte da atualização 2.5, mas a documentação de imagens ainda observa que personagens recorrentes e elementos de marca podem perder consistência entre gerações. A conclusão prática é simples: preserve o arquivo de origem e teste toda a cadeia de edição, não apenas a primeira instrução.
GPT Image 2.5 vs GPT Image 2: preços, velocidade relatada e custo registrado
A OpenAI relata que o Flare pode reduzir a latência em até 50% em comparação com o GPT Image 2. Leve “até” a sério. Prompts complexos ainda podem levar até dois minutos, de acordo com o guia oficial de imagens, e tráfego, entrada de imagem, qualidade e dimensões podem alterar o resultado.
Os preços publicados por token também exigem cuidado. No momento da verificação, a tabela central de preços da API da OpenAI lista as seguintes tarifas padrão por um milhão de tokens:
| Modelo |
Entrada de texto |
Entrada de texto em cache |
Entrada de imagem |
Entrada de imagem em cache |
Saída de imagem |
| GPT Image 2 |
$2.50 |
$0.625 |
$4.00 |
$1.00 |
$15.00 |
| GPT Image 2.5 Flare |
$5.00 |
$1.25 |
$8.00 |
$2.00 |
$30.00 |
| GPT Image 2.5 Sunburst |
$5.00 |
$1.25 |
$8.00 |
$2.00 |
$30.00 |
Há um conflito de documentação que vale divulgar. As páginas individuais do Flare e do Sunburst atualmente dizem que suas tarifas por token correspondem ao GPT Image 2, enquanto a tabela central de preços lista o GPT Image 2 com metade das tarifas do 2.5. A tabela central é a comparação atual mais clara, mas os preços devem ser verificados novamente imediatamente antes da publicação.
Mesmo uma tabela de tarifas correta não revela o custo por imagem aceita. O guia oficial diz aos desenvolvedores para inspecionar o usage da resposta porque os modelos podem consumir números diferentes de tokens na mesma qualidade nominal. Uma saída que custa menos, mas exige duas novas tentativas, pode ser a escolha cara.
O painel de custos fornecido relata o gasto total do benchmark completo. O conjunto de testes contém cinco chamadas registradas por modelo: dois prompts de texto para imagem, a edição inicial do rótulo, o acompanhamento da estrela e o acompanhamento do fundo.
| Modelo |
Chamadas registradas |
Total cobrado |
Média por chamada registrada |
Diferença vs GPT Image 2 |
| GPT Image 2 |
5 |
$0.2002 |
$0.0400 |
Linha de base |
| Flare |
5 |
$0.2601 |
$0.0520 |
+29.9% |
| Sunburst |
5 |
$0.2487 |
$0.0497 |
+24.2% |
Os três modelos custaram $0.7090 no total pelas 15 chamadas registradas. GPT Image 2 foi o mais barato nesta execução. Sunburst custou 4,4% menos que Flare, apesar de ambos os modelos 2.5 compartilharem as mesmas tarifas por token publicadas, o que é um lembrete útil de que o preço de tabela e o valor cobrado por uma saída específica não são a mesma medição.
Essas médias são descritivas, não preços fixos por imagem. Os totais do painel não expõem a latência por chamada ou o uso de tokens de saída, e o requisito contraditório de proporção no Teste 3 impede um cálculo defensável de custo por imagem aceita. Não inferir velocidade testada a partir deste screenshot de custos. Use a declaração de latência da OpenAI apenas como uma afirmação do fornecedor até que carimbos de data e hora das solicitações estejam disponíveis.
Para preços do GPT Proto, use as tarifas ao vivo nas páginas dos modelos GPT Image 2, Flare e Sunburst ao executar o benchmark. Armazene o valor realmente cobrado junto com a saída, em vez de copiar uma tarifa para uma planilha uma vez e assumir que ela nunca mudará.
O que rankings independentes e usuários dizem
O sinal independente inicial favorece os novos modelos. No ranking da Text-to-Image Arena datado de 7 de setembro de 2026, Sunburst ficou em primeiro lugar com 1421±13 de 3.149 votos, Flare ficou em segundo com 1399±13 de 2.856 votos, e GPT Image 2 Medium ficou em terceiro com 1381±4 de 78.731 votos.
O ranking de edição de imagem única mostrou a mesma ordem: Sunburst com 1520±9 de 6.704 votos, Flare com 1491±9 de 5.676 votos, e GPT Image 2 Medium com 1461±3 de 235.928 votos.
Esses números apoiam testar o 2.5 primeiro. Eles não provam que o Sunburst vencerá o Flare em todos os projetos. Ambas as entradas 2.5 estão marcadas como Preliminary, suas contagens de votos são muito menores que as do GPT Image 2, e as margens de classificação de texto para imagem de Flare e Sunburst se sobrepõem. A leitura responsável é “forte liderança inicial”, não “vencedor universal consolidado”.
As reações da comunidade são menos organizadas. Em um tópico de comparação no Reddit, alguns participantes viram texto mais legível ou composição mais realista no 2.5, enquanto outros disseram que as saídas pareciam praticamente iguais. Um usuário também relatou mais erros de moderação e guardrails em prompts aparentemente inofensivos. O próprio tópico atraiu acusações de promoção e análise não confiável, então nenhum desses comentários deve ser tratado como dado de benchmark.
Essa discordância é útil por um motivo: mostra por que testes rotulados e reproduzíveis importam. Um único exemplo atraente é evidência de que um modelo pode produzir aquela imagem. Não é evidência de uma taxa de aprovação confiável.
GPT Image 2.5 Flare vs Sunburst vs GPT Image 2: qual você deve usar?
Para um fluxo de trabalho de edição multirodada como o testado aqui, escolha Flare primeiro. Ele acumulou o menor desvio visível após as instruções da estrela e do fundo. A OpenAI também o posiciona como a opção 2.5 mais rápida, embora a latência não tenha sido registrada neste benchmark.
Escolha Sunburst quando a preservação da origem em uma edição única exigente ou o polimento visual final forem mais importantes. Ele venceu o teste de preservação relativa e produziu o acabamento visual mais forte na rodada estrita de geração de produto. Não direcione todos os rascunhos para o Sunburst apenas porque ele está no topo de um ranking inicial.
Mantenha GPT Image 2 quando a aderência literal ao prompt e o orçamento importarem mais do que o teto de qualidade da família 2.5. Ele venceu a lista de verificação mais estrita de texto para imagem, empatou no texto exato do anúncio e registrou o menor gasto total. Números de versão não são um plano de migração: se uma mudança criar novas falhas de layout, interrupções de moderação ou regressões de prompt, o modelo mais novo ainda pode ser a pior escolha operacional para esse fluxo de trabalho.
| Condição do projeto |
Comece com |
Escale ou volte quando |
| Edições multirodada ou variantes frequentes |
Flare |
Use Sunburst quando a primeira edição que preserva a origem não cumprir uma regra de qualidade escrita. |
| Edições únicas sensíveis à origem ou assets finais de campanha |
Sunburst |
Tente Flare quando a consistência cumulativa, a latência ou o volume se tornarem o gargalo. |
| Briefings literais ou produção sensível a custo |
GPT Image 2 |
Teste Flare em paralelo e migre apenas quando a taxa de aprovação ou a velocidade operacional melhorar o suficiente para compensar o maior gasto observado. |
| Qualidade máxima 2.5 |
Sunburst ou Flare em max |
Não compare este resultado diretamente com GPT Image 2 em high. |
Minha recomendação é rotear, não coroar um modelo para tudo. Use Flare para edição iterativa, Sunburst para trabalho sensível à preservação ou de qualidade final, e GPT Image 2 para solicitações literais e sensíveis a custo. Mantenha os três sob os mesmos testes de aceitação, em vez de rotear apenas pela versão do modelo.
Como testar os três modelos com uma única chave de API do GPT Proto
O GPT Proto expõe cada modelo por meio de seu próprio endpoint, mantendo autenticação e saldo da conta em um único lugar. A solicitação abaixo segue o formato mostrado na página ao vivo do modelo Flare. Defina MODEL_ID como qualquer um dos três IDs e mantenha os outros campos fixos para o benchmark.
export GPTPROTO_API_KEY="YOUR_GPTPROTO_API_KEY"
export MODEL_ID="gpt-image-2.5-flare"
curl --request POST \
"https://gptproto.com/api/v3/openai/${MODEL_ID}/text-to-image" \
--header "Authorization: Bearer ${GPTPROTO_API_KEY}" \
--header "Content-Type: application/json" \
--data '{
"prompt": "Crie uma fotografia editorial quadrada de produto para uma marca fictícia de água com gás. Coloque exatamente três latas finas de alumínio sobre um pedestal coral claro: uma lata amarelo-limão no centro, uma lata verde-menta à esquerda e uma lata azul-céu à direita. Imprima o nome da marca MORI FIZZ uma vez em cada lata. Adicione dois limões fatiados ao lado do pedestal, não em cima dele. Use um fundo creme quente, sombras suaves de tarde e um visual de fotografia de estúdio com lente de 50 mm. Sem pessoas, sem latas extras, sem frutas flutuando, sem texto duplicado e sem borda.",
"n": null,
"quality": "high",
"size": "1024x1024",
"enable_sync_mode": false,
"response_format": "url"
}'
Execute a solicitação três vezes com estes valores:
gpt-image-2
gpt-image-2.5-flare
gpt-image-2.5-sunburst
Salve o identificador de tarefa retornado, o carimbo de data/hora de conclusão, os dados de uso, a URL de saída e o valor cobrado juntos. Para uma migração de produção, envie uma pequena amostra de solicitações existentes do GPT Image 2 para o Flare em paralelo, sem alterar a rota voltada ao usuário. Compare os resultados primeiro. Depois mova apenas os prompts que passarem.
Você também pode testar os modelos visualmente por meio do Gerador de Imagens com IA do GPT Proto. Para estruturas de prompt reutilizáveis, a Coleção de Prompts do GPT Image 2 fornece um ponto de partida, mas mantenha os prompts do benchmark congelados assim que os testes começarem.
Veredito final
GPT Image 2.5 é a melhor família para testar em novos trabalhos de API de imagem, mas este benchmark não justifica uma migração geral do GPT Image 2.
Flare é a melhor escolha para a sequência testada de edição multirodada porque acumulou o menor desvio visual. Sunburst é o especialista mais forte para uma primeira edição que preserva a origem e acabamento visual premium. GPT Image 2 continua sendo o melhor resultado de custo-benefício aqui: seguiu o briefing de geração mais estrito da forma mais literal e custou $0.2002 em cinco chamadas, em comparação com $0.2601 para Flare e $0.2487 para Sunburst.
Os rankings públicos favorecem Sunburst, depois Flare, depois GPT Image 2. A lacuna de confiança, a diferença de tamanho de amostra, o conflito de documento de preços e os relatos anedóticos da comunidade argumentam todos contra tratar essa ordem como a resposta final para sua aplicação.
Use o mesmo prompt. Trave os parâmetros. Conte as falhas. Depois migre.