Preços+7% bônus

O que é DeepSeek V4 Flash Vision Exp? Preços, Funcionalidades, Benchmarks e Limites

DeepSeek V4 Flash Vision Exp explicado: preços atuais, limites de 384 tokens para imagens, benchmarks do Opus 4.8, casos de uso e onde ele fica aquém.

O que é DeepSeek V4 Flash Vision Exp? Preços, Funcionalidades, Benchmarks e Limites

Várias páginas publicadas imediatamente após o lançamento do DeepSeek V4 Flash Vision Exp já estão citando o preço errado. É assim que este lançamento está avançando rápido.

O DeepSeek V4 Flash Vision Exp é uma versão experimental do V4 Flash que pode aceitar imagens junto com texto. Ele pode inspecionar capturas de tela, ler texto em imagens, analisar gráficos e passar o resultado para ferramentas. A DeepSeek o lançou em 21 de agosto de 2026 sob o ID de modelo deepseek-v4-flash-vision-exp.

A distinção importante é o que ele não é. Este não é um novo gerador de imagens, e não é uma atualização geral para toda carga de trabalho do V4 Flash. A DeepSeek o posiciona como uma ramificação experimental com suporte a visão e com capacidades de texto aproximadamente iguais às do V4 Flash. Se sua aplicação nunca envia uma imagem, o modelo de texto padrão continua sendo a escolha mais simples.

O DeepSeek V4 Flash Vision Exp agora está disponível por meio do GPTProto. Desenvolvedores podem enviar entrada de texto e imagem pela rota GPTProto do modelo usando a mesma conta, chave de API e saldo compartilhado usados para outros modelos compatíveis. A página do modelo ao vivo atualmente lista o preço padrão de $0.44 por milhão de tokens de entrada e $1.32 por milhão de tokens de saída, com taxas fora de pico baseadas em horário também disponíveis.

O modelo continua experimental. Antes de direcionar tráfego de produção para ele, teste o formato exato de imagem, os limites de requisição, a latência e o comportamento de fallback mostrados no Início Rápido ao vivo da GPTProto.

Índice

O que mudou em relação ao DeepSeek V4 Flash?

A atualização é limitada, mas útil: o V4 Flash agora pode receber contexto visual. Uma requisição pode conter texto mais uma ou mais imagens JPEG, PNG, GIF ou WebP. A DeepSeek expõe essa capacidade por meio de suas APIs Chat Completions e Responses compatíveis com OpenAI, bem como de sua API Messages compatível com Anthropic.

As imagens podem chegar de três maneiras:

  1. Uma URL de dados Base64 embutida na requisição.

  2. Uma URL HTTP ou HTTPS publicamente acessível.

  3. Um file_id criado por meio da API de Arquivos.

A terceira opção importa quando um agente precisa inspecionar a mesma captura de tela mais de uma vez. Faça o upload uma vez, reutilize o identificador e evite enviar o arquivo inteiro a cada requisição. A DeepSeek diz que os uploads na Files API são gratuitos, mas a inferência não é: a imagem ainda é convertida em tokens de entrada e cobrada junto com o texto que a acompanha.

Aqui está a divisão prática entre as três rotas V4 atuais:

Modelo Entrada de imagem Contexto oficial / saída máxima Entrada/saída de pico com cache miss Adequação prática
DeepSeek V4 Flash Vision Exp Sim 1M / 384K $0.44 / $1.32 por 1M de tokens Experimentos com capturas de tela, gráficos, imagens de documentos e agentes de GUI
DeepSeek V4 Flash Não 1M / 384K $0.44 / $1.32 por 1M de tokens Texto em alto volume, extração, chat e subtarefas rotineiras de agentes
DeepSeek V4 Pro Não 1M / 384K $1.32 / $3.96 por 1M de tokens Codificação mais difícil, raciocínio e tarefas de agente mais longas

Essas são as taxas de pico oficiais atuais, não uma promessa de que os preços permanecerão inalterados. A DeepSeek reserva-se explicitamente o direito de ajustá-las.

Minha leitura prática é simples. Escolha o Vision Exp porque você precisa de entrada de imagem, não porque Vision soa como um nível superior. Escolha o V4 Flash quando o trabalho for somente texto e sensível a custo. Mova tarefas de texto difíceis para o V4 Pro quando a qualidade de raciocínio adicional valer aproximadamente três vezes o preço oficial dos tokens.

Recursos do DeepSeek V4 Flash Vision Exp — e seus limites reais

A lista curta de recursos parece generosa: texto e imagens misturados, chamadas de ferramentas, saída JSON, modo de pensamento selecionável, três formatos de API e o mesmo contexto de 1M de tokens mostrado para os outros modelos V4. Os limites são o que determina se esses recursos sobrevivem ao contato com uma carga de trabalho de produção.

Método de entrada Limite Melhor uso
Base64 ou inline file_data Corpo inteiro da requisição: 48 MiB Imagens locais e requisições de uso único
URL externa URL: 8,192 caracteres; imagem: 32 MiB; download: 60 segundos Imagens públicas que já estão hospedadas
Files API file_id Imagem: 64 MiB Imagens reutilizadas ou requisições que excederiam o limite do corpo inline

A colocação da imagem depende do formato da API. Em requisições Chat Completions e Messages compatíveis com Anthropic, o conteúdo de imagem pertence a uma mensagem de usuário. A API Responses também pode receber imagens em mensagens de desenvolvedor e em saídas de chamadas de ferramentas compatíveis. Imagens colocadas em mensagens de sistema ou assistente retornam um erro 400. Enviar uma imagem para as rotas V4 Flash ou V4 Pro somente texto também retorna um erro, porque esses modelos não aceitam entrada nativa de imagem.

O Vision Exp oferece suporte a configurações de detalhe low, high, original e auto para entradas image_url, mas o modelo ainda aplica seu processo de redimensionamento documentado. Imagens abaixo de aproximadamente 384×384 na escala total de pixels são ampliadas. Imagens maiores são reduzidas preservando a proporção até que sua contagem total de pixels seja aproximadamente equivalente a 800×800.

Esse redimensionamento produz um teto de 384 tokens de entrada por imagem. Isso torna o custo previsível. O trade-off é a resolução: rótulos minúsculos, planilhas densas, anotações finas em diagramas e textos pequenos de UI podem não sobreviver à redução. Uma fonte de 5,000×5,000 não compra mais tokens de imagem do que uma fonte de 2,000×2,000.

Mais um limite é fácil de passar despercebido. O Vision Exp não oferece suporte a FIM completion, enquanto o V4 Flash e o V4 Pro o suportam no modo não pensante. Desenvolvedores que criam ferramentas de preenchimento de código inline não devem tratar a rota de visão como um substituto direto.

Preços do DeepSeek V4 Flash Vision Exp

Verifiquei a tabela de preços ao vivo da DeepSeek em 24 de agosto de 2026. As tarifas são:

Tipo de token Fora de pico Pico
Entrada com cache hit $0.007 por 1M $0.014 por 1M
Entrada com cache miss $0.22 por 1M $0.44 por 1M
Saída $0.66 por 1M $1.32 por 1M

Os horários de pico vão das 01:00–04:00 e 06:00–10:00 UTC, de segunda a sexta-feira. Todos os outros períodos, incluindo fins de semana, usam a tarifa fora de pico com metade do preço.

Alguns explicadores indexados recentemente ainda citam $0.14 por milhão de tokens de entrada e $0.28 por milhão de tokens de saída. Não monte um orçamento com base nesses números. Eles não correspondem mais à tabela oficial.

Com o teto documentado de 384 tokens por imagem, o cálculo de entrada somente de imagem é:

Fora de pico: 384 × $0.22 / 1,000,000 = $0.00008448 por imagem
Pico:     384 × $0.44 / 1,000,000 = $0.00016896 por imagem

Isso dá aproximadamente $0.08448–$0.16896 para 1,000 imagens antes de texto e saída. É barato, mas a manchete pode ser enganosa. Uma resposta de 1,000 tokens custa $0.00132 na tarifa de pico de saída — quase oito vezes a cobrança máxima de entrada por uma imagem. Respostas concisas e max_tokens controlado podem importar mais do que economizar alguns tokens na imagem.

O número 384 também é um máximo, não uma cobrança fixa por imagem. O uso real de tokens depende das dimensões após a etapa de redimensionamento da DeepSeek.

DeepSeek V4 Flash Vision Exp vs Opus 4.8

A DeepSeek diz que o Vision Exp traz desempenho de agente multimodal próximo ao Opus 4.8. Seu próprio gráfico de benchmark sustenta uma afirmação mais restrita: os modelos alternam vitórias em quatro avaliações selecionadas de agentes multimodais.

Benchmark de agente multimodal Vision Exp Opus 4.8 Maior pontuação
ApexBench, Pass@1 36.5 39.4 Opus 4.8
Agents' Last Exam 27.3 25.7 Vision Exp
Chartography 64.3 65.0 Opus 4.8
ZeroBench, Pass@5 35.0 34.0 Vision Exp

Duas vitórias para cada. Isso é competitivo, mas não é prova de que o Vision Exp iguala o Opus 4.8 em precisão de OCR, taxas de alucinação visual, leitura de textos pequenos, navegação de UI ou agentes de longa duração.

Os resultados de agentes de texto adicionam mais contexto. O gráfico da DeepSeek contém sete avaliações baseadas em texto. O Vision Exp lidera sobre o Opus 4.8 apenas no DeepSWE, 59.3 a 58.0. Ele fica atrás em Terminal Bench 2.1, NL2Repo, Cybergym, Toolathlon-Verified, DSBench-Hard e AutomationBench.

Esses números também vêm da DeepSeek, não de um avaliador independente. A empresa executou seus modelos no Minimal Mode com comprimento máximo de saída, top_p=0.95 e temperature=1.0. Em 24 de agosto, não consegui encontrar o Vision Exp nos resultados do Artificial Analysis ou do LMArena. Minha conclusão, portanto, é provisória: os dados de lançamento justificam testar o modelo, não declarar um vencedor geral.

Aplicações do DeepSeek V4 Flash Vision Exp

Agentes de captura de tela e GUI

Um agente de navegador ou desktop pode inspecionar uma tela, decidir qual ferramenta chamar e revisar a próxima captura de tela. O baixo teto de tokens de imagem mantém observações repetidas baratas. O custo é a precisão visual, então teste rótulos pequenos, texto de erro e menus densos antes de confiar em cliques autônomos.

Análise de gráficos e imagens de documentos

O modelo pode resumir gráficos, extrair fatos visíveis e combiná-los com instruções de texto. Ele deve funcionar melhor em páginas limpas e legíveis. Letras miúdas digitalizadas e planilhas grandes são mais arriscadas porque as imagens são redimensionadas antes da inferência.

Agentes de codificação que revisam interfaces

Um agente de codificação pode gerar uma página, inspecionar o resultado renderizado e então revisar o código. Isso fecha uma lacuna deixada pelo V4 Flash somente texto. Ainda assim, uma captura de tela não é uma árvore DOM: o modelo pode notar um botão fora de lugar sem identificar a regra CSS exata que causou isso.

Fluxos de trabalho com imagens repetidas

A Files API é adequada para catálogos de produtos, revisão de documentos ou qualquer fluxo que se refira a uma imagem ao longo de vários turnos. Reutilizar um file_id economiza largura de banda de requisição. Isso não remove as cobranças de tokens de imagem quando o modelo processa esse arquivo novamente.

Quando não usá-lo

O Vision Exp é um padrão fraco para texto puro, inspeção em nível de pixel ou sistemas que exigem um contrato de modelo estável. O sufixo -exp importa. Mantenha testes de regressão, registre o comportamento do modelo e mantenha uma rota de fallback se um fluxo visual afetar dinheiro, permissões ou dados de clientes.

Como usar o DeepSeek V4 Flash Vision Exp via API

O DeepSeek V4 Flash Vision Exp está disponível por meio do endpoint compatível com OpenAI da GPT Proto. O exemplo em Python a seguir envia uma imagem pública de gráfico junto com uma instrução de texto:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["GPTPROTO_API_KEY"],
    base_url="https://gptproto.com/v1",
)

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[
        {
            "role": "user",
            "content": [
                {
                    "type": "text",
                    "text": "Leia este gráfico e liste as três descobertas mais importantes."
                },
                {
                    "type": "image_url",
                    "image_url": {
                        "url": "https://api-docs.deepseek.com/img/v4_260821_benchmark_en.png"
                    }
                }
            ]
        }
    ],
)

print(response.choices[0].message.content)

O exemplo usa a imagem pública de benchmark da DeepSeek, então pode ser executado sem preparar uma imagem primeiro. Para um arquivo local, codifique-o como uma URL de dados Base64; para um arquivo grande ou usado repetidamente, faça o upload primeiro e envie seu file_id. O guia da API de Visão da DeepSeek documenta todos os três formatos.

Usando o Vision Exp através da GPT Proto

A GPT Proto agora expõe o DeepSeek V4 Flash Vision Exp como uma rota multimodal com entrada de texto e imagem e saída de texto. A tarifa padrão atual é $0.44 por milhão de tokens de entrada e $1.32 por milhão de tokens de saída. Tokens de imagem são adicionados à conta de entrada de texto, com a DeepSeek documentando um teto de 384 tokens de entrada por imagem.

A vantagem prática é a consolidação de conta: a mesma chave GPT Proto e o saldo compartilhado também podem chamar DeepSeek V4 Flash e DeepSeek V4 Pro somente texto. Isso facilita direcionar tarefas visuais para o Vision Exp enquanto mantém o trabalho de texto rotineiro no modelo Flash estável.

Vale a pena usar o DeepSeek V4 Flash Vision Exp?

Sim — para testar agentes cientes de imagem onde o custo de entrada e capturas de tela repetidas importam. Não — como uma atualização automática para um aplicativo somente texto.

Os pontos fortes confirmados são ampla compatibilidade de API, uso previsível de tokens de imagem, um contexto de 1M de tokens e resultados relatados pelo fornecedor que são pelo menos competitivos com o Opus 4.8 em quatro testes de agentes multimodais. Os custos são um contrato experimental, redimensionamento agressivo de imagem, nenhum resultado de benchmark independente ainda e desempenho misto contra o Opus em vez de uma vitória limpa.

Se sua carga de trabalho for somente texto, comece com DeepSeek V4 Flash e escale solicitações difíceis de codificação ou raciocínio para DeepSeek V4 Pro. Se capturas de tela, gráficos, renderizações de interface ou imagens de documentos contiverem informações de que o agente precisa, teste a API do DeepSeek V4 Flash Vision Exp diretamente através da GPT Proto.

Não promova a rota experimental para produção com base apenas em quatro benchmarks relatados pelo fornecedor. Teste-a contra seus próprios textos pequenos, painéis densos, bugs visuais e fluxos de trabalho de ferramentas em várias etapas primeiro.

Perguntas Frequentes

O que é o DeepSeek V4 Flash Vision Exp?

É uma versão experimental do DeepSeek V4 Flash com suporte a visão, lançada em 21 de agosto de 2026. Aceita texto e imagens e usa o ID de modelo `deepseek-v4-flash-vision-exp`.

O Vision Exp é uma atualização em relação ao DeepSeek V4 Flash?

Ele adiciona compreensão de imagens, mas a DeepSeek descreve suas capacidades de texto como equivalentes às do V4 Flash, em vez de substituí-lo. Para solicitações apenas de texto, a rota padrão do V4 Flash continua sendo a opção mais direta.

Quanto custa o DeepSeek V4 Flash Vision Exp?

No momento da verificação, a entrada com cache miss custa US$ 0,22 fora de pico ou US$ 0,44 em pico por milhão de tokens. A saída custa US$ 0,66 fora de pico ou US$ 1,32 em pico. Os preços podem mudar.

Quantos tokens uma imagem usa?

Até 384 tokens de entrada após redimensionamento automático. Este é um limite máximo, não uma cobrança fixa, e cada imagem em uma solicitação com várias imagens é contada separadamente.

O DeepSeek V4 Flash Vision Exp é melhor que o Opus 4.8?

Não de forma conclusiva. Nos quatro testes de agentes multimodais publicados pela DeepSeek, o Vision Exp vence dois e o Opus 4.8 vence dois. Resultados independentes não estavam disponíveis quando este artigo foi verificado.

Como ele se compara a outros modelos DeepSeek?

O Vision Exp é a opção V4 atual para entrada de imagens. O V4 Flash é voltado para cargas de trabalho de texto econômicas, enquanto o V4 Pro cobra mais por codificação e raciocínio mais difíceis. Os três listam um contexto de 1M de tokens e saída máxima de 384K na tabela de preços atual da DeepSeek.

O DeepSeek V4 Flash Vision Exp é open source?

A documentação atual de lançamento e API da DeepSeek não confirma um lançamento de pesos abertos para o Vision Exp. Não presuma que o status de outros modelos DeepSeek se aplique a este endpoint experimental.

O DeepSeek V4 Flash Vision Exp está disponível na GPTProto?

Sim. A GPTProto agora fornece acesso ao `deepseek-v4-flash-vision-exp` com entrada de texto e imagem e saída de texto. Desenvolvedores podem usar uma chave de API da GPTProto e saldo compartilhado para testar o modelo ao lado do V4 Flash, V4 Pro e outros modelos multimodais suportados. Consulte a [página do modelo ao vivo](https://gptproto.com/model/deepseek/deepseek-v4-flash-vision-exp) para preços atuais, modalidades e instruções de início rápido.

Quais aplicações são adequadas para o modelo?

Os candidatos mais claros são agentes de captura de tela, análise de gráficos e imagens de documentos, revisão de UI e outros fluxos de trabalho que combinam imagens com chamadas de ferramentas. Aplicações que dependem de texto muito pequeno ou detalhes em resolução original exigem testes adicionais.

Artigos relacionados

Mais blogs
DeepSeek V4 Pro vs DeepSeek V4 Flash: Qual é melhor para codificação, agentes e seu orçamento?

DeepSeek V4 Pro vs DeepSeek V4 Flash: Qual é melhor para codificação, agentes e seu orçamento?

Resposta rápida: Para a maioria das cargas de trabalho cotidianas de API — chat, geração de conteúdo, codificação simples e tarefas em lote de alto volume — DeepSeek V4 Flash é a melhor escolha porque oferece qualidade quase-Pro por aproximadamente um terço do preço, com 5× o limite de simultaneidade. DeepSeek V4 Pro só vale o preço premium quando você precisa de codificação agêntica de ponta, raciocínio complexo de várias etapas ou refatorações em escala de repositório, em que uma primeira tentativa malsucedida custa mais do que a diferença de 3× no preço dos tokens. Se você é um desenvolvedor criando agentes de codificação ou ferramentas de front-end, comece com Flash e atualize para o Pro para os 10–20% das tarefas mais difíceis.

Tiffany Layne | 2026-08-19

DeepSeek V4 Pro vs GLM 5.2: Qual é melhor em 2026?

DeepSeek V4 Pro vs GLM 5.2: Qual é melhor em 2026?

Dois modelos chineses de pesos abertos agora estão a uma margem de erro de arredondamento da vanguarda ocidental — por uma fração do preço. DeepSeek V4 Pro e GLM 5.2 (da Z.ai, anteriormente Zhipu) são os dois modelos que os desenvolvedores continuam colocando lado a lado em 2026, e por um bom motivo: ambos oferecem uma janela de contexto de 1 milhão de tokens, ambos têm pesos abertos e ambos custam de 5 a 10 vezes menos que Claude e GPT. Mas "qual é melhor" não tem uma única resposta — isso depende de você priorizar desenvolvimento frontend , raciocínio algorítmico , confiabilidade em agentes ou custo bruto por tarefa . A maioria das comparações para no preço de tabela. Esta vai além: analisamos o gasto real por tarefa , a precificação dinâmica recém-ativada do DeepSeek, a eficiência de tokens e os modos de falha que cada modelo oculta. Se quiser testar qualquer um dos modelos diretamente, você pode executá-los lado a lado aqui: DeepSeek V4 Pro → gptproto.com/model/deepseek/deepseek-v4-pro GLM 5.2 → gptproto.com/model/z-ai/glm-5.2

Michael Johnson | 2026-08-17

O preço de pico da DeepSeek já está ativo: quando a API custa mais?

O preço de pico da DeepSeek já está ativo: quando a API custa mais?

Se você acordou no dia 17 de agosto e a fatura da sua API DeepSeek de repente parecia diferente, não é imaginação sua. A DeepSeek lançou oficialmente o Peak Pricing — um modelo de cobrança baseado em horários de pico e fora de pico, que muda quanto você paga por token dependendo de quando suas solicitações chegam à API. Em resumo: rode suas cargas de trabalho durante os horários de pico e você paga o preço cheio. Mude-as para horários mais tranquilos e você paga metade . Este guia detalha exatamente o que é o DeepSeek Peak Pricing, quando a API custa mais, quanto custa em cada nível e no que você deve ficar atento.

Michael Johnson | 2026-08-17

Grok 4.6 vs DeepSeek V4 Pro: Programação, Preços e Qual é Melhor?

Grok 4.6 vs DeepSeek V4 Pro: Programação, Preços e Qual é Melhor?

rok 4.6 e DeepSeek V4 Pro foram projetados para tarefas difíceis de raciocínio e programação, mas não são intercambiáveis. Grok 4.6 é a opção mais forte quando a tarefa envolve capturas de tela, protótipos de interfaces, depuração visual ou os problemas mais difíceis de programação agêntica. DeepSeek V4 Pro é mais atraente quando custo, contexto longo e programação baseada em texto em grande volume são as prioridades. A resposta curta é simples: Grok 4.6 é o modelo mais completo, enquanto DeepSeek V4 Pro é o modelo de programação mais econômico. Esta comparação entre Grok 4.6 e DeepSeek V4 Pro aborda programação, desenvolvimento frontend, janelas de contexto, evidências de benchmarks públicos, preços da API e a atualização mais recente do DeepSeek V4 Pro. Ela também explica qual modelo faz mais sentido para diferentes cargas de trabalho de desenvolvedores. Veredito rápido: escolha Grok 4.6 para trabalho frontend visual, depuração difícil e tarefas de programação de alto risco. Escolha DeepSeek V4 Pro para repositórios extensos, fluxos de trabalho com muito texto e custos menores de API. Para roteamento em produção, DeepSeek V4 Pro pode lidar com a carga padrão, enquanto Grok 4.6 assume escalonamentos visuais ou difíceis.

Tiffany Layne | 2026-08-13