DeepSeek V4: Flash vs Pro, recursos e como usar

DeepSeek V4 é a família hospedada atual. Em 23/08/2026, ela inclui deepseek-v4-flash, deepseek-v4-pro e o experimental deepseek-v4-flash-vision-exp. Flash e Pro recebem texto; Vision Exp recebe texto e imagens.

Atualização documental — 23 de agosto de 2026. A família hospedada atual inclui deepseek-v4-flash, deepseek-v4-pro e o experimental deepseek-v4-flash-vision-exp. Os três funcionam em Chat Completions, Responses API e Anthropic API. Flash e Pro recebem texto; Vision Exp recebe texto e imagens. Os testes publicados nesta página antes de 21/08/2026 continuam válidos apenas como retratos históricos dos modelos, preços e protocolos registrados em cada data.

Teste controlado: V4 Flash e V4 Pro com o mesmo prompt

Executamos o mesmo prompt em português nos dois modelos, com Thinking desativado e com esforço High. O teste documenta formato, consumo e um limite de configuração; não mede qualidade geral nem estabelece vencedor.

Prompt: Compare os números decimais 9,11 e 9,8. Responda em uma única frase com o maior número.

Matriz do teste funcional V4 Flash e V4 Pro com o mesmo prompt em modos Thinking e Non-Thinking
Teste original com o mesmo prompt em português, uma chamada por condição. Tokens e latências são observações pontuais, não benchmark.
Modelo e modoHTTP / fimResposta finalEvidência de reasoningEntrada / saída / total
Flash Non-Thinking200 / stop9,8 é o maiorAusente31 / 24 / 55
Flash Thinking High; max_tokens: 384200 / stop9,8 é o maiorPresente; 155 tokens31 / 165 / 196
Pro Non-Thinking200 / stop9,8 é o maiorAusente31 / 11 / 42
Pro Thinking High; max_tokens: 384200 / stop9,8 é o maiorPresente; 182 tokens31 / 192 / 223

Limite observado: em uma primeira rodada com max_tokens: 128, Flash e Pro consumiram os 128 tokens em raciocínio, encerraram por length e deixaram content vazio. Ao repetir High com 384, ambos concluíram por stop. Isso é limite da configuração testada, não incapacidade do modelo.

Metodologia e limites

  • Mesmo prompt e mesma data; respostas não streaming; uma chamada por condição.
  • Thinking definido explicitamente como disabled ou enabled com reasoning_effort: high.
  • Sem rubrica cega, repetição estatística, programação, agentes ou contexto longo.
  • O raciocínio bruto não é publicado e latências isoladas não sustentam comparação de velocidade.

Detalhes de configuração em Thinking Mode; catálogo e aliases em Modelos e API.

Retrato histórico: os testes desta página foram executados antes do lançamento do DeepSeek-V4-Pro-0813 em 13/08/2026. Eles preservam o comportamento observado na data e no protocolo indicados, mas não avaliam a versão hospedada atual do Pro.

Evidência independente em português brasileiro

Em 8 de agosto de 2026, ampliamos a verificação para 72 chamadas autenticadas, com 12 tarefas em português brasileiro e três repetições por modelo. O Flash obteve 30/36 aprovações estritas e 66/72 pontos; o Pro, 32/36 e 68/72. Não houve falha crítica. Na mesma janela, o Pro custou cerca de 3,2 vezes o Flash e teve latência mediana 28,4% maior.

Dois acertos formais a mais não tornam o Pro um vencedor universal. Escolha pelo seu corpus, limite de latência e orçamento — não apenas pelo nome do modelo. Veja o teste completo do DeepSeek V4 em português no Brasil, com prompts, respostas brutas, protocolo, revisão dos validadores e arquivos para reprodução.

Em 29/07/2026, deepseek-chat e deepseek-reasoner ainda responderam nesta conta e retornaram V4 Flash, mas ficaram fora de GET /models. Para código novo, use IDs V4 explícitos; veja a auditoria dos aliases.

Resposta rápida: comece com deepseek-v4-flash. Teste deepseek-v4-pro como atualização opcional quando raciocínio, código ou agentes complexos exigirem qualidade adicional. “Preview” descreve o lançamento histórico de abril; o estado hospedado atual é Flash-0731 beta e Pro-0813 GA.

Este é um guia independente em português brasileiro. Não somos a DeepSeek e não temos parceria ou endosso oficial. Especificações e disponibilidade foram rechecadas em 24 de agosto de 2026; os testes históricos de 29 de julho e 8 de agosto permanecem datados. Para comparar outras famílias e seus status, consulte o índice de modelos DeepSeek.

Para entender onde o V4 se encaixa entre chat, aplicativo e API, consulte o guia geral do DeepSeek no Brasil.

DeepSeek V4 em resumo

AspectoEstado atual
IDs hospedadosdeepseek-v4-flash, deepseek-v4-pro, deepseek-v4-flash-vision-exp
EntradaTexto em Flash/Pro; texto e imagens no Vision Exp
ContextoAté 1M tokens
Saída máximaAté 384K tokens, dentro do contexto total
ModosThinking e Non-Thinking; Thinking ativado por padrão
InterfacesChat Completions, Responses API e Anthropic API
ImagensJPEG, PNG, GIF e WebP; somente no Vision Exp
Files APIUpload e reutilização de imagens por file_id; não é PDF/RAG gerenciado

V4 Flash, V4 Pro e Vision Exp

CaracterísticaV4 FlashV4 ProV4 Flash Vision Exp
IDdeepseek-v4-flashdeepseek-v4-prodeepseek-v4-flash-vision-exp
EntradaTextoTextoTexto e imagens
EstadoBeta públicoGAExperimental
Contexto / saída máx.1M / 384K1M / 384K1M / 384K
Thinking / Non-ThinkingSimSimSim
JSON Output / Tool CallsSim / SimSim / SimSim / Sim
Responses / AnthropicSim / SimSim / SimSim / Sim
FIM CompletionNon-ThinkingNon-ThinkingNão suportado
Concorrência padrão2.5005002.500
Perfil inicialCusto e escalaTarefas complexasCompreensão visual experimental

Segundo os resultados publicados pela própria DeepSeek, o V4 Pro se destaca em conhecimento, matemática, STEM, código e tarefas agentivas. A empresa descreve o Flash como próximo do Pro em raciocínio. Esses números são benchmarks do fornecedor; valide os modelos nos seus próprios dados.

Como funciona o Vision Exp

deepseek-v4-flash-vision-exp aceita imagens junto com texto. A documentação mostra três formas de entrada: Base64, URL HTTP(S) pública ou file_id obtido pela Files API. Em Chat Completions, use blocos text, image_url ou file; em Responses, use input_image; no formato Anthropic, use um bloco image.

Os formatos aceitos são JPEG, PNG, GIF e WebP. Imagens inline ou por URL têm limite de 32 MiB por imagem; por file_id, até 64 MiB. O máximo documentado é 600 imagens por requisição. Imagens são convertidas em tokens e cobradas como entrada.

Para conhecer as famílias multimodais anteriores com pesos para execução própria, veja DeepSeek VL e DeepSeek-VL2. Elas não são aliases nem versões locais do Vision Exp hospedado.

Files API: escopo correto

A Files API permite enviar imagens uma vez e reutilizá-las por file_id. Ela oferece criação, listagem, consulta e exclusão, com até 64 MiB por upload, 25 GiB de armazenamento por usuário e até 10 mil arquivos armazenados.

Esse recurso não extrai PDFs, não cria embeddings, não oferece vector store e não monta uma base RAG. Para documentos textuais ou uma base de conhecimento, a aplicação ainda precisa extrair, segmentar, indexar, controlar acesso e validar respostas.

Limite temporal: os testes Flash/Pro abaixo foram realizados antes do lançamento do Vision Exp e não avaliam visão, OCR, Files API nem o modelo experimental.

Comparação documentada entre DeepSeek V4 Flash e V4 Pro: parâmetros, contexto, recursos, preços e concorrência da API em 29 de julho de 2026.
Comparação documental entre DeepSeek V4 Flash e V4 Pro, com dados oficiais verificados em 29 de julho de 2026.

Metodologia e limites desta comparação

Cruzamos o anúncio do V4 Preview, a lista atual de modelos, a tabela de preços, os limites de concorrência e o guia de Thinking Mode, todos consultados em 29 de julho de 2026. A diferença de aproximadamente 68% no preço sem cache e na saída é um cálculo local sobre as tarifas publicadas; a concorrência de 2.500 contra 500 é um limite padrão por conta documentado, não uma medição de velocidade.

Limite do teste: fizemos chamadas autenticadas pontuais a Flash e Pro em Non-Thinking e Thinking High; também repetimos a condição Thinking depois de observar o limite de max_tokens: 128. Não reproduzimos os benchmarks da fabricante nem executamos uma avaliação estatística de qualidade, latência ou taxa de sucesso. Portanto, estes resultados registram somente as configurações e respostas observadas nesta conta em 29 de julho de 2026. Uma comparação de qualidade exige prompts fixos, várias repetições, rubrica cega e publicação dos dados brutos.

O que mudou na arquitetura?

A DeepSeek descreve V4 como um modelo Mixture-of-Experts com grande diferença entre parâmetros totais e ativos por token. O lançamento também apresenta duas técnicas centrais:

  • DeepSeek Sparse Attention (DSA): mecanismo de atenção esparsa criado para lidar com contexto longo com mais eficiência.
  • Token-wise compression: técnica de compressão citada pela DeepSeek em conjunto com DSA para melhorar a eficiência do contexto; os detalhes da implementação estão no relatório técnico.

Essas características ajudam a explicar a janela de contexto extensa, mas não garantem precisão em qualquer documento longo. A qualidade ainda depende de instruções, posição da evidência, ruído, idioma, formato e critérios de avaliação.

Contexto de 1 milhão de tokens: o que significa?

A janela de contexto reúne entrada e saída dentro do limite aceito pelo serviço. A saída máxima anunciada é de 384 mil tokens, portanto “1M de contexto” não significa que toda resposta possa ter 1 milhão de tokens.

  • Documentos maiores ainda precisam de limpeza, estrutura e seleção de trechos relevantes.
  • RAG continua útil quando a base muda, precisa de citações ou possui controle de acesso.
  • Enviar mais conteúdo aumenta latência, custo e superfície para instruções maliciosas.
  • Teste recuperação de fatos distribuídos no início, meio e fim do contexto.

Uma janela longa não elimina a necessidade de engenharia de contexto, recuperação, validação ou revisão humana.

Em um estudo separado, publicamos um teste reproduzível do V4 com documentos longos em português, com resultados até 512 mil tokens e limites explícitos.

Thinking e Non-Thinking Mode

Os três modelos hospedados funcionam em Thinking e Non-Thinking Mode. O Thinking Mode está ativado por padrão e retorna o raciocínio em reasoning_content, separado da resposta final em content. Na interface OpenAI, reasoning_effort aceita low, high ou max.

ModoQuando usarObservação
ThinkingProblemas com várias etapas, análise, código e planejamentotemperature, top_p, presence_penalty e frequency_penalty são aceitos apenas por compatibilidade e não produzem efeito no modo atual
Non-ThinkingRespostas diretas, extração, classificação e menor latênciaPermite recursos como FIM Completion

Ao combinar Thinking Mode e Tool Calls, devolva integralmente o reasoning_content da mensagem do assistente em todas as requisições subsequentes desse fluxo. Se ele não for reenviado corretamente, a API pode retornar HTTP 400. Veja os parâmetros e exemplos corretos no guia de Thinking Mode.

Recursos disponíveis na API

RecursoFlashProVision ExpObservação
TextoSimSimSim
ImagensNãoNãoSimJPEG, PNG, GIF e WebP
JSON OutputSimSimSimValide o JSON recebido
Tool CallsSimSimSimA aplicação autoriza e executa
Responses APISimSimSimImagens somente no Vision Exp
Anthropic APISimSimSimO formato dos blocos difere
Chat Prefix CompletionSimSimSimBeta
FIM CompletionNon-ThinkingNon-ThinkingNão
Context CachingSimSimSimAutomático e best effort

Para implementação, veja os guias de DeepSeek API, Vision e Files API.

Como acessar o DeepSeek V4

Web e aplicativo

O V4 está disponível nos produtos oficiais de chat na web e no aplicativo. A interface pública pode apresentar modos de produto em vez dos IDs técnicos da API. Não presumimos que nomes como “Expert” e “Instant” correspondam necessariamente a Pro e Flash sem uma declaração oficial explícita. Para instalar com segurança, use o guia do DeepSeek App.

API hospedada

Use deepseek-v4-flash ou deepseek-v4-pro para entrada textual. Use deepseek-v4-flash-vision-exp quando a tarefa realmente precisar de imagens e puder aceitar um modelo experimental. A API mantém base URL compatível com OpenAI e um endpoint Anthropic-compatible; compatibilidade de formato não significa que todo recurso de outro provedor exista.

Pesos publicados

A DeepSeek publicou pesos e relatório técnico do V4. Execução própria exige infraestrutura compatível, runtime, segurança, monitoramento e análise da licença do checkpoint. “Pesos abertos” não significa operação simples, custo zero ou ausência de obrigações.

Migração de deepseek-chat e deepseek-reasoner

Atualização de 29 de julho de 2026: a DeepSeek anunciou que os aliases legados seriam totalmente retirados após 24 de julho de 2026, às 15:59 UTC. Esse prazo já terminou. A lista oficial atual apresenta deepseek-v4-flash e deepseek-v4-pro. Em 29/07/2026, os dois aliases ainda responderam HTTP 200 nesta conta e retornaram V4 Flash, embora ausentes de GET /models. A tabela registra o mapeamento e a migração explícita recomendada:

Alias antigoMapeamento documentado na transiçãoMigração explícita
deepseek-chatV4 Flash em Non-Thinkingdeepseek-v4-flash com Thinking desativado
deepseek-reasonerV4 Flash em Thinkingdeepseek-v4-flash com Thinking ativado

V4 Pro não é o equivalente automático de deepseek-reasoner. Durante a janela de compatibilidade, o mapeamento documentado para esse alias era V4 Flash com Thinking. Pro pode ser adotado como upgrade opcional baseado em testes.

Faça inventário de código, variáveis, dashboards, testes e documentação que ainda usam os aliases. Migre para um ID V4 explícito, consulte GET /models e rode testes de regressão antes de implantar. O teste de 29/07/2026 observou os dois aliases roteando para V4 Flash nesta conta; isso não garante continuidade.

Custo e posicionamento

ModeloPeríodoCache hitCache missSaída
Flash / Vision ExpFora de picoUS$ 0,007US$ 0,22US$ 0,66
Flash / Vision ExpPicoUS$ 0,014US$ 0,44US$ 1,32
ProFora de picoUS$ 0,022US$ 0,66US$ 1,98
ProPicoUS$ 0,044US$ 1,32US$ 3,96

O pico ocorre das 01:00 às 04:00 UTC e das 06:00 às 10:00 UTC, de segunda a sexta-feira; todos os demais horários são fora de pico. Confirme a página de preços antes de estimar produção.

Qual versão escolher?

  • Escolha V4 Flash para construir a primeira versão, processar alto volume, resumir, extrair, classificar e responder tarefas diretas.
  • Use Flash com Thinking para raciocínio eficiente e para migrar do antigo deepseek-reasoner.
  • Teste V4 Pro em código complexo, planejamento, conhecimento difícil ou agentes em que o Flash não alcança o critério mínimo.
  • Considere pesos próprios somente se infraestrutura, licença, controle e custo total fizerem sentido.

Monte um conjunto de avaliações com casos fáceis, médios, difíceis e adversariais. Meça acurácia, taxa de aprovação humana, latência, tokens, custo, falhas de ferramenta e consistência. Veja exemplos de aplicação na página de casos de uso do DeepSeek.

Limitações e cuidados

  • O modelo pode produzir fatos, referências ou código incorretos.
  • Benchmarks publicados pelo desenvolvedor não substituem uma avaliação independente.
  • Contexto longo não garante que todo detalhe será recuperado corretamente.
  • Tool Calls exigem validação de argumentos, permissões, allowlists e confirmação para ações sensíveis.
  • Não envie segredos ou dados pessoais desnecessários.
  • Decisões médicas, jurídicas, financeiras, laborais ou de segurança precisam de profissional qualificado e revisão humana.
  • Recursos, versões, limites e preços podem mudar; registre a data de cada verificação.

Perguntas frequentes

DeepSeek V4 é uma versão final?

O lançamento de abril conserva o nome histórico “DeepSeek-V4 Preview”. O estado hospedado atual é mais específico: Flash-0731 permanece em beta público e Pro-0813 está em disponibilidade geral.

Qual é melhor: V4 Flash ou V4 Pro?

Depende da tarefa. Flash oferece menor custo e maior capacidade de escala; Pro é a opção mais forte para demandas complexas. Comece com Flash e promova casos específicos ao Pro quando testes justificarem.

DeepSeek V4 tem 1 milhão de tokens de saída?

Não. O contexto anunciado é de 1 milhão de tokens e a saída máxima anunciada é de 384 mil, respeitando o limite total.

DeepSeek R1 foi substituído pelo V4 Pro?

Não. R1 é uma família de modelos e não é um ID atual da API hospedada. Durante a janela de compatibilidade anunciada, deepseek-reasoner foi mapeado para V4 Flash com Thinking; a lista oficial atual apresenta somente os IDs V4 explícitos. Consulte o guia do DeepSeek R1.

O V4 aceita imagens pela API?

Sim, mas somente por meio do modelo experimental deepseek-v4-flash-vision-exp. deepseek-v4-flash e deepseek-v4-pro continuam sendo opções de entrada textual. O Vision Exp aceita JPEG, PNG, GIF e WebP em Chat Completions, Responses e Anthropic, por Base64, URL pública ou file_id.

Os pesos do V4 podem ser executados localmente?

A DeepSeek publicou pesos, mas “local” pode exigir infraestrutura de grande porte. Verifique model card, licença, formatos, quantização, memória e compatibilidade do runtime.

Fontes oficiais consultadas

Transparência editorial: este conteúdo é independente e não representa recomendação, parceria ou endosso oficial da DeepSeek. Informações verificadas documentalmente em 24 de agosto de 2026; os testes permanecem datados de 29 de julho e 8 de agosto de 2026.