Compreensão Nativa de Imagens
Envie capturas de tela, gráficos, mockups de interface ou outras imagens com instruções de texto. O modelo retorna texto e pode usar descobertas visuais ao decidir qual ferramenta chamar em seguida.
curl --request POST "https://gptproto.com/v1/chat/completions" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "deepseek-v4-flash-vision-exp",
"messages": [
{
"role": "user",
"content": "Hello"
}
]
}'Chat, agentes de programação e trabalho com documentos. Preço por 1M de tokens — entrada, entrada em cache e saída são cobradas separadamente.
| Cenário | Lista de DeepSeek | OpenRouter | GPTProto | Economia / mês |
|---|---|---|---|---|
| Pessoal10M tokens / mês (4.8M cache) | $3.39 | $3.58 | $3.39 | −$0.00≈ $0.00 / ano |
| Equipe100M tokens / mês (48M cache) | $33.89 | $35.75 | $33.89 | −$0.00≈ $0.00 / ano |
| Empresarial500M tokens / mês (240M cache) | $169.44 | $178.76 | $169.44 | −$0.00≈ $0.00 / ano |
Use a API DeepSeek V4 Flash Vision Exp para combinar imagens, texto, raciocínio e chamadas de ferramentas no mesmo fluxo de trabalho. O modelo pode inspecionar capturas de tela, ler texto visível, interpretar gráficos e usar evidências visuais enquanto trabalha em código ou tarefas de várias etapas. Ele mantém os recursos de texto do V4 Flash enquanto adiciona entrada nativa de imagens.
Compreensão Nativa de Imagens
Envie capturas de tela, gráficos, mockups de interface ou outras imagens com instruções de texto. O modelo retorna texto e pode usar descobertas visuais ao decidir qual ferramenta chamar em seguida.
Contexto de 1M e Saída de 384K
Mantenha grandes repositórios, conversas longas, resultados de ferramentas e evidências visuais em uma única requisição. Os limites documentados do modelo são uma janela de contexto de 1M tokens e até 384K tokens de saída.
Três Formatos de API
A DeepSeek documenta suporte a Chat Completions, Messages e Responses para o modelo de visão, facilitando conectar frameworks de agentes existentes sem redesenhar todo o fluxo de requisições.
Uso Previsível de Tokens de Imagem
As imagens são convertidas em tokens de entrada e cobradas junto com o texto. A DeepSeek limita cada imagem a 384 tokens, ajudando equipes a estimar custos de fluxos de trabalho com capturas de tela repetidas e múltiplas imagens.
DeepSeek V4 Flash Vision Exp é uma versão multimodal experimental do modelo V4 Flash, lançada por meio da API DeepSeek em 21 de agosto de 2026. Ele aceita entrada de texto e imagem e produz saída de texto. A DeepSeek posiciona suas capacidades de agente puramente textual, raciocínio e conhecimento de mundo como comparáveis à versão padrão do V4 Flash, ao mesmo tempo que relata uma melhoria substancial em benchmarks de agente que exigem compreensão visual.
A principal diferença não é apenas a legendagem de imagens. Um agente orientado por ferramentas pode receber uma captura de tela de um navegador ou ferramenta de teste, identificar problemas de layout ou conteúdo, modificar arquivos, solicitar uma nova captura de tela e avaliar o resultado novamente. Isso torna o modelo relevante para codificação frontend, triagem de regressão visual, análise de gráficos, revisão de imagens de documentos e fluxos de trabalho nos quais evidências importantes não estão disponíveis como texto simples.
| Especificação | DeepSeek V4 Flash Vision Exp |
|---|---|
| Fornecedor | DeepSeek |
| Status de lançamento | Modelo experimental de API, lançado em 21 de agosto de 2026 |
| ID oficial do modelo | deepseek-v4-flash-vision-exp |
| Entrada / saída | Texto e imagens / texto |
| Janela de contexto | 1M tokens |
| Saída máxima | 384K tokens |
| Raciocínio | Modos de raciocínio e sem raciocínio; o raciocínio é o padrão documentado |
| Formatos de API | Chat Completions, Messages e Responses |
| Entrega de imagens | URL externa, URL de dados base64 ou Files API na API oficial da DeepSeek |
| Formatos de imagem compatíveis | JPEG, PNG, GIF e WebP |
| Uso de tokens por imagem | Até 384 tokens de entrada por imagem |
| Chamadas de ferramentas e saída JSON | Compatível |
| Conclusão FIM | Não compatível com o modelo de visão |
| Status de pesos abertos | Nenhum peso oficial separado do Vision Exp foi publicado em 25 de agosto de 2026 |
Codificação frontend orientada por capturas de tela: Dê a um agente o design de destino, sua renderização atual no navegador e ferramentas de edição. Ele pode identificar diferenças visíveis, corrigir a implementação e revisar a próxima captura de tela. A inspeção visual deve complementar verificações de DOM e testes automatizados, não substituí-los.
Triagem de bugs visuais: Combine uma captura de tela de erro com logs e arquivos de origem relevantes. O modelo pode conectar o que o usuário vê com evidências textuais da base de código e então propor uma correção delimitada ou chamar ferramentas de diagnóstico.
Análise de gráficos e dashboards: Peça ao modelo para interpretar tendências, rótulos e anomalias visíveis. Verifique os números extraídos com o conjunto de dados subjacente, pois a leitura visual não substitui o acesso a dados estruturados.
Revisão de slides e múltiplas imagens: Use imagens de páginas como referências enquanto o agente elabora ou verifica uma apresentação, ou encaminhe lotes de capturas de tela por uma rubrica consistente. Teste textos pequenos, tabelas densas e detalhes visuais finos antes de confiar na aprovação automatizada.
Capture evidências: Um navegador, ferramenta de teste ou usuário fornece uma captura de tela junto com a tarefa e o contexto textual relevante.
Inspecione e planeje: O modelo identifica elementos visíveis, compara-os com os requisitos e escolhe a próxima ferramenta de código, navegador ou análise.
Modifique e valide: O agente edita arquivos ou configuração, executa verificações determinísticas e captura uma nova renderização.
Compare novamente: O modelo revisa a nova imagem e continua apenas quando o resultado visual e as verificações de aceitação não visuais concordam.
O modelo não recebe controle do navegador apenas porque oferece suporte a imagens. Seu aplicativo ainda precisa fornecer ferramentas, permissões, timeouts e critérios de aceitação. O acesso ao modelo é uma camada; o harness do agente ao redor controla a execução e a segurança.
O esquema oficial atual da DeepSeek aceita JPEG, PNG, GIF e WebP. No formato Responses, detail: low reduz a imagem para 512 × 512, enquanto high, original, e auto mantêm a imagem original. O provedor documenta até 600 imagens por solicitação, com limite de 32 MiB para uma imagem inline e 64 MiB para uma imagem referenciada por file_id.
No formato Responses, imagens podem ser colocadas em mensagens de usuário ou desenvolvedor e em saídas de chamadas de ferramentas. Imagens em mensagens de sistema ou assistente retornam um erro. Use o exemplo ao vivo de Uso da API GPTProto como fonte da verdade para o formato de solicitação compatível e quaisquer limites específicos do gateway antes de colocar um fluxo de trabalho em lote em produção.
| Fator de decisão | Vision Exp | V4 Flash |
|---|---|---|
| Status de lançamento | Endpoint multimodal experimental | Modelo de texto estável |
| Entrada nativa | Texto e imagens | Somente texto |
| Capacidade de texto | Posicionado pela DeepSeek como equivalente ao V4 Flash | Capacidade baseline do V4 Flash |
| Agentes dependentes de visão | Projetado para usar capturas de tela, gráficos e imagens retornadas por ferramentas | Ignora ou não consegue processar diretamente conteúdo de imagem nativo |
| Contexto / saída máxima | 1M / 384K | 1M / 384K |
| Cobrança de tokens de imagem | Até 384 tokens de entrada por imagem | Não aplicável |
| Conclusão FIM | Não compatível | Compatível no modo sem raciocínio |
| Melhor aplicação | Codificação visual, inspeção de UI, análise de gráficos, ciclos de ferramentas multimodais | Codificação somente em texto, logs, extração estruturada e subtarefas de agente em alto volume |
Escolha o Vision Exp quando uma imagem contiver informações que o agente precisa para agir. Escolha DeepSeek V4 Flash quando a carga de trabalho for totalmente baseada em texto, um endpoint estável importar mais do que entrada visual, ou o aplicativo já converter imagens em dados estruturados verificados. A comparação publicada pela DeepSeek diz que as duas variantes são comparáveis em tarefas de texto, então há pouca razão para encaminhar toda solicitação somente de texto pelo modelo experimental.
Escolha-o quando capturas de tela ou artefatos visuais aparecerem repetidamente dentro de um ciclo de agente: implementação frontend, QA baseado em navegador, revisão de gráficos, geração de slides ou casos de suporte em que o estado visível importa. Seu contexto de 1M e saída de 384K também são adequados para sessões longas de repositório.
Use um modelo estável somente de texto quando imagens forem irrelevantes. Para codificação multimodal de maior risco, compare o Vision Exp com GPT-5.6 Sol, Claude Opus 5, e Kimi K3 nas mesmas tarefas. A DeepSeek não fornece um resultado público comparável contra esses três modelos. Meça conclusão de tarefas, repetições, chamadas de ferramenta inválidas, precisão visual, latência e custo por resultado aceito antes de escolher uma rota padrão.