Visão nativa e contexto de 1M
Processe texto, capturas de tela, gráficos, páginas digitalizadas e documentos longos em uma única solicitação, com compreensão nativa de imagens e uma janela de contexto de até um milhão de tokens.
curl --request POST "https://gptproto.com/v1/chat/completions" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "deepseek-flash",
"messages": [
{
"role": "user",
"content": "Hello"
}
]
}'Chat, agentes de programação e trabalho com documentos. Preço por 1M de tokens — entrada, entrada em cache e saída são cobradas separadamente.
| Cenário | Lista de DeepSeek | OpenRouter | GPTProto | Economia / mês |
|---|---|---|---|---|
| Pessoal10M tokens / mês (4.8M cache) | $3.39 | $3.58 | $3.39 | −$0.00≈ $0.00 / ano |
| Equipe100M tokens / mês (48M cache) | $33.89 | $35.75 | $33.89 | −$0.00≈ $0.00 / ano |
| Empresarial500M tokens / mês (240M cache) | $169.44 | $178.76 | $169.44 | −$0.00≈ $0.00 / ano |
Crie com o modelo Flash atual da DeepSeek para codificação em escala de repositório, análise de documentos longos, saída estruturada, chamadas de ferramentas e compreensão nativa de imagens. O modelo oferece suporte a até 1M tokens de contexto, até 384K de saída e operação com ou sem pensamento. Para extração de imagens e orientação de prompts visuais, use a API DeepSeek Flash Image-to-Text.
Visão nativa e contexto de 1M
Processe texto, capturas de tela, gráficos, páginas digitalizadas e documentos longos em uma única solicitação, com compreensão nativa de imagens e uma janela de contexto de até um milhão de tokens.
Arquitetura CED eficiente
O MoE de 552B parâmetros ativa 8B parâmetros durante o prefill e 16B durante a geração, reduzindo os requisitos de computação e de cache KV para cargas de trabalho com uso intenso de entrada.
Esforço de raciocínio ajustável
Use o modo de pensamento para tarefas difíceis de programação e de agentes ou o modo sem pensamento para trabalho rotineiro; depois, ajuste o esforço de raciocínio com base em qualidade, latência e uso de tokens.
Fluxos de trabalho de agentes prontos para ferramentas
Combine chamadas de ferramentas, saída JSON, streaming e estado de conversas longas para agentes que inspecionam repositórios, analisam evidências visuais, chamam funções e continuam por várias etapas.
A API do DeepSeek Flash usa a string de modelo exata deepseek-flash para acessar o DeepSeek V4.1 Flash. Lançado em 10 de setembro de 2026, este modelo multimodal de Mistura de Especialistas aceita texto e imagens e gera texto. Ele substitui os modelos experimentais descontinuados V4 Flash e V4 Flash Vision por trás de seus aliases legados.
Sua arquitetura Codificador-Decodificador Causal de 40 camadas tem 20 camadas de codificador e 20 de decodificador. O backbone de 552B parâmetros ativa 8B parâmetros por token durante o prefill e 16B durante a decodificação. A DeepSeek relata um cache KV global de 890 bytes por token—cerca de um quarto do V4 Flash—e uma pegada persistente cerca de um oitavo do tamanho. O design é voltado para agentes com uso intensivo de entrada e fluxos de trabalho com documentos longos.
O GPTProto lista o modelo em sua taxa padrão, portanto esta página não alega desconto. Sua vantagem é o acesso consolidado: uma chave e saldo podem testá-lo ao lado de mais de 200 alternativas e configurar fallbacks sem contas separadas de provedores.
| Especificação | DeepSeek Flash no GPTProto |
|---|---|
| String de modelo GPTProto | deepseek-flash |
| Versão atual do modelo | DeepSeek V4.1 Flash |
| Provedor | DeepSeek |
| Data de lançamento | 10 de setembro de 2026 |
| Tipo de modelo | Modelo multimodal de Mistura de Especialistas |
| Entrada e saída | Texto e imagens para texto |
| Janela de contexto | Até 1M tokens |
| Saída máxima | Até 384K tokens |
| Parâmetros backbone | 552B |
| Parâmetros ativos | 8B durante prefill; 16B durante decodificação |
| Arquitetura | Codificador-Decodificador Causal de 40 camadas |
| Capacidades da API | Modos de pensamento e não-pensamento, chamadas de ferramentas, saída JSON, streaming, API Responses e API compatível com Anthropic |
| Status de pesos abertos | Pesos do modelo lançados sob a Licença MIT |
| Posição de preço | Taxa padrão do modelo GPTProto; sem alegação de desconto |
deepseek-flash é a string de modelo da API; DeepSeek V4.1 Flash é a versão atualmente servida por essa rota. Eles não são camadas separadas, então esta página também responde a pesquisas por “deepseek-v4.1-flash API” sem apresentar essa frase como um segundo identificador de requisição.
| Nome | Função | Uso recomendado |
|---|---|---|
deepseek-flash |
String de modelo atual da API | Use em requisições GPTProto após confirmar o valor do painel |
| DeepSeek V4.1 Flash | Versão atual do modelo subjacente | Use em textos de página, relatórios de avaliação e referências de lançamento |
deepseek-v4-flash |
Alias de compatibilidade de modelo descontinuado | Migre novas integrações para deepseek-flash |
deepseek-v4-flash-vision-exp |
Alias de experimento de visão descontinuado | Migre fluxos de trabalho visuais para deepseek-flash |
Não inferir uma string de API versionada a partir do nome de lançamento. Mantenha deepseek-flash na configuração e registre a versão resolvida nos logs de avaliação.
O V4.1 consolida o acesso geral ao Flash e o acesso experimental à visão em uma única rota multimodal. Seu design CED assimétrico usa menos parâmetros ativos para entrada do que para saída, enquanto a atenção CSA2 e o cache KV comprimido reduzem a pegada de memória de prompts longos. A DeepSeek também expandiu o pós-treinamento orientado a agentes.
Antes de migrar um aplicativo V4 Flash existente, teste a análise de resposta, argumentos de ferramenta, campos de raciocínio, latência e uso de tokens. Os aliases de compatibilidade não identificam mais os modelos descontinuados que originalmente referenciavam.
Codificação em escala de repositório: Combine arquivos fonte relevantes, especificações, logs e saída de testes para análise entre arquivos, planejamento de migração, depuração, elaboração de patches e revisão.
Análise de documentos longos: Revise especificações, contratos, relatórios, transcrições ou históricos de suporte com mais material de origem no contexto. Foque o prompt e limite a saída.
Agentes de múltiplas etapas: Use chamadas de ferramentas, saída estruturada e streaming para inspecionar dados, chamar funções, avaliar resultados e revisar um plano. Seu aplicativo ainda executa ferramentas e impõe permissões.
Fluxos de trabalho com reconhecimento de imagem: Conecte capturas de tela, gráficos, diagramas ou páginas digitalizadas com contexto escrito. Para extração no estilo OCR, resposta visual a perguntas e limites de imagem específicos da tarefa, continue para a API de Imagem para Texto do DeepSeek Flash.
A DeepSeek atualmente lista deepseek-flash e deepseek-v4-pro como APIs ativas separadas. Ela reverteu uma eliminação planejada do V4 Pro e continua esse serviço após 14 de setembro de 2026. Avalie ambos com seus prompts reais, ferramentas, limites e testes de aceitação.
| Fator de decisão | DeepSeek Flash (V4.1 Flash) | DeepSeek V4 Pro |
|---|---|---|
| String de modelo da API | deepseek-flash |
deepseek-v4-pro |
| Versão atual | DeepSeek V4.1 Flash | DeepSeek V4-Pro-0813 |
| Entrada de imagem nativa | Suportado | Não suportado |
| Janela de contexto | 1M tokens | 1M tokens |
| Saída máxima | 384K tokens | 384K tokens |
| Parâmetros backbone | 552B | 1.6T |
| Parâmetros ativos | 8B prefill / 16B decodificação | 49B |
| Terminal-Bench 2.1 | 90.6 | 87.9 |
| DeepSWE v1.1 | 74.2 | 62.7 |
| Status atual do provedor | Ativo | Ativo após 14 de setembro de 2026; mudanças futuras exigem aviso |
| Ponto de partida prático | Novas implantações multimodais, de codificação, de contexto longo e de agentes | Continuidade de regressão para cargas de trabalho existentes do V4 Pro e testes de comparação somente texto |
Estes são resultados relatados pela DeepSeek com esforço máximo de raciocínio, não testes independentes do GPTProto. O Flash liderou estas avaliações agênticas, enquanto o V4 Pro liderou alguns testes de conhecimento e raciocínio no mesmo cartão de modelo. Nenhuma pontuação isolada estabelece superioridade universal.
O modo de pensamento é habilitado por padrão na API nativa da DeepSeek. Lá, temperature, presence_penalty, e frequency_penalty não têm efeito; top_p é pelo menos 0.95 no modo de pensamento e fixado em 1.0 caso contrário. Confirme os controles expostos do GPTProto antes de publicar código.
Para solicitações em modo de pensamento com ferramentas, a DeepSeek exige reasoning_content anterior em solicitações subsequentes, ou sua API nativa retorna um erro 400. Verifique o tratamento do GPTProto, valide argumentos de ferramenta, restrinja permissões e defina limites de etapa, token e tempo limite.
Escolha o DeepSeek Flash para entrada visual nativa, contexto em escala de repositório, saída longa, raciocínio orientado a codificação ou uso repetido de ferramentas. Cargas de trabalho adequadas incluem depuração assistida por captura de tela, análise de documentos técnicos, migração de base de código e agentes com estado.
Para classificação curta, roteamento ou reescrita, compare com um modelo menor. Para tarefas difíceis, execute a mesma avaliação por meio de outra opção no diretório de modelos GPTProto e compare qualidade, latência, uso de tokens e recuperação.
Guias, comparações e atualizações relacionadas a este modelo.
Todos os artigos
Compare MiniMax M3 e Tencent Hunyuan 4 para codificação, tarefas de frontend, agentes de IA, preços, contexto e auto-hospedagem. Veja qual modelo se encaixa no seu projeto.

DeepSeek V4.1 Flash explicado: veja seu status de lançamento beta, velocidade relatada de 300–500 tok/s, preços, recursos multimodais nativos e comparações de modelos.

Compare GPT-6 Astra vs Claude Fable 5.1 para codificação, trabalho de frontend, agentes, benchmarks, preços de API, custos de cache e custo por tarefa bem-sucedida.

Compare Qwen3.8-Max-0902 vs Claude Fable 5.1 para codificação, desenvolvimento de frontend, agentes de IA, preços de API, contexto e custo-benefício.