DeepSeek V4: Flash vs Pro, recursos e como usar

O DeepSeek-V4 Preview é a geração lançada pela DeepSeek em 24 de abril de 2026. A família combina contexto de até 1 milhão de tokens, Thinking e Non-Thinking Mode e duas opções hospedadas: V4 Flash, voltado à velocidade e economia, e V4 Pro, indicado para tarefas mais exigentes.

Teste controlado: V4 Flash e V4 Pro com o mesmo prompt

Executamos o mesmo prompt em português nos dois modelos, com Thinking desativado e com esforço High. O teste documenta formato, consumo e um limite de configuração; não mede qualidade geral nem estabelece vencedor.

Prompt: Compare os números decimais 9,11 e 9,8. Responda em uma única frase com o maior número.

Matriz do teste funcional V4 Flash e V4 Pro com o mesmo prompt em modos Thinking e Non-Thinking
Teste original com o mesmo prompt em português, uma chamada por condição. Tokens e latências são observações pontuais, não benchmark.
Modelo e modoHTTP / fimResposta finalEvidência de reasoningEntrada / saída / total
Flash Non-Thinking200 / stop9,8 é o maiorAusente31 / 24 / 55
Flash Thinking High; max_tokens: 384200 / stop9,8 é o maiorPresente; 155 tokens31 / 165 / 196
Pro Non-Thinking200 / stop9,8 é o maiorAusente31 / 11 / 42
Pro Thinking High; max_tokens: 384200 / stop9,8 é o maiorPresente; 182 tokens31 / 192 / 223

Limite observado: em uma primeira rodada com max_tokens: 128, Flash e Pro consumiram os 128 tokens em raciocínio, encerraram por length e deixaram content vazio. Ao repetir High com 384, ambos concluíram por stop. Isso é limite da configuração testada, não incapacidade do modelo.

Metodologia e limites

  • Mesmo prompt e mesma data; respostas não streaming; uma chamada por condição.
  • Thinking definido explicitamente como disabled ou enabled com reasoning_effort: high.
  • Sem rubrica cega, repetição estatística, programação, agentes ou contexto longo.
  • O raciocínio bruto não é publicado e latências isoladas não sustentam comparação de velocidade.

Detalhes de configuração em Thinking Mode; catálogo e aliases em Modelos e API.

Em 29/07/2026, deepseek-chat e deepseek-reasoner ainda responderam nesta conta e retornaram V4 Flash, mas ficaram fora de GET /models. Para código novo, use IDs V4 explícitos; veja a auditoria dos aliases.

Resposta rápida: comece com deepseek-v4-flash. Teste deepseek-v4-pro como atualização opcional quando raciocínio, código ou agentes complexos exigirem qualidade adicional. “Preview” faz parte do nome oficial atual; esta página não apresenta o modelo como V4 Final.

Este é um guia independente em português brasileiro. Não somos a DeepSeek e não temos parceria ou endosso oficial. Especificações e disponibilidade foram conferidas em 29 de julho de 2026. Para comparar outras famílias e seus status, consulte o índice de modelos DeepSeek.

DeepSeek V4 em resumo

Nome oficial do lançamentoDeepSeek-V4 Preview
Data de lançamento24 de abril de 2026
Opções hospedadasV4 Flash e V4 Pro
IDs atuais da APIdeepseek-v4-flash e deepseek-v4-pro
ContextoAté 1 milhão de tokens
Saída máxima anunciadaAté 384 mil tokens, dentro do contexto total
ModosThinking e Non-Thinking; Thinking ativado por padrão
AcessoWeb, aplicativo, API e pesos publicados
Interfaces da APIOpenAI Chat Completions e formato Anthropic

V4 Flash vs V4 Pro

CaracterísticaDeepSeek V4 FlashDeepSeek V4 Pro
ID da APIdeepseek-v4-flashdeepseek-v4-pro
Parâmetros totais anunciados284 bilhões1,6 trilhão
Parâmetros ativos anunciados13 bilhões49 bilhões
Contexto1M tokens1M tokens
Saída máxima384K tokens384K tokens
Thinking / Non-ThinkingSim / SimSim / Sim
PerfilMais rápido, econômico e adequado à escalaMais capacidade para tarefas complexas
Ponto de partidaChat, resumo, extração, classificação e agentes simplesRaciocínio exigente, programação com agentes e tarefas avançadas

Segundo os resultados publicados pela própria DeepSeek, o V4 Pro se destaca em conhecimento, matemática, STEM, código e tarefas agentivas. A empresa descreve o Flash como próximo do Pro em raciocínio e semelhante em tarefas simples de agentes. Esses números são benchmarks do desenvolvedor: valide ambos nos seus próprios dados antes de escolher.

Comparação documentada entre DeepSeek V4 Flash e V4 Pro: parâmetros, contexto, recursos, preços e concorrência da API em 29 de julho de 2026.
Comparação documental entre DeepSeek V4 Flash e V4 Pro, com dados oficiais verificados em 29 de julho de 2026.

Metodologia e limites desta comparação

Cruzamos o anúncio do V4 Preview, a lista atual de modelos, a tabela de preços, os limites de concorrência e o guia de Thinking Mode, todos consultados em 29 de julho de 2026. A diferença de aproximadamente 68% no preço sem cache e na saída é um cálculo local sobre as tarifas publicadas; a concorrência de 2.500 contra 500 é um limite padrão por conta documentado, não uma medição de velocidade.

Limite do teste: fizemos chamadas autenticadas pontuais a Flash e Pro em Non-Thinking e Thinking High; também repetimos a condição Thinking depois de observar o limite de max_tokens: 128. Não reproduzimos os benchmarks da fabricante nem executamos uma avaliação estatística de qualidade, latência ou taxa de sucesso. Portanto, estes resultados registram somente as configurações e respostas observadas nesta conta em 29 de julho de 2026. Uma comparação de qualidade exige prompts fixos, várias repetições, rubrica cega e publicação dos dados brutos.

O que mudou na arquitetura?

A DeepSeek descreve V4 como um modelo Mixture-of-Experts com grande diferença entre parâmetros totais e ativos por token. O lançamento também apresenta duas técnicas centrais:

  • DeepSeek Sparse Attention (DSA): mecanismo de atenção esparsa criado para lidar com contexto longo com mais eficiência.
  • Token-wise compression: técnica de compressão citada pela DeepSeek em conjunto com DSA para melhorar a eficiência do contexto; os detalhes da implementação estão no relatório técnico.

Essas características ajudam a explicar a janela de contexto extensa, mas não garantem precisão em qualquer documento longo. A qualidade ainda depende de instruções, posição da evidência, ruído, idioma, formato e critérios de avaliação.

Contexto de 1 milhão de tokens: o que significa?

A janela de contexto reúne entrada e saída dentro do limite aceito pelo serviço. A saída máxima anunciada é de 384 mil tokens, portanto “1M de contexto” não significa que toda resposta possa ter 1 milhão de tokens.

  • Documentos maiores ainda precisam de limpeza, estrutura e seleção de trechos relevantes.
  • RAG continua útil quando a base muda, precisa de citações ou possui controle de acesso.
  • Enviar mais conteúdo aumenta latência, custo e superfície para instruções maliciosas.
  • Teste recuperação de fatos distribuídos no início, meio e fim do contexto.

Uma janela longa não elimina a necessidade de engenharia de contexto, recuperação, validação ou revisão humana.

Thinking e Non-Thinking Mode

Os dois modelos funcionam em dois modos. O Thinking Mode está ativado por padrão e retorna o raciocínio em reasoning_content, separado da resposta final em content. Na interface OpenAI, reasoning_effort aceita high ou max.

ModoQuando usarObservação
ThinkingProblemas com várias etapas, análise, código e planejamentotemperature, top_p, presence_penalty e frequency_penalty são aceitos apenas por compatibilidade e não produzem efeito no modo atual
Non-ThinkingRespostas diretas, extração, classificação e menor latênciaPermite recursos como FIM Completion

Ao combinar Thinking Mode e Tool Calls, devolva integralmente o reasoning_content da mensagem do assistente em todas as requisições subsequentes desse fluxo. Se ele não for reenviado corretamente, a API pode retornar HTTP 400. Veja os parâmetros e exemplos corretos no guia de Thinking Mode.

Recursos disponíveis na API

RecursoV4 FlashV4 ProNota
JSON OutputSimSimValide sempre o JSON recebido
Tool CallsSimSimO backend executa e autoriza a ferramenta
Chat Prefix CompletionSimSimRecurso Beta
FIM CompletionSimSimSomente em Non-Thinking Mode
Context CachingSimSimAutomático e de melhor esforço

Para implementação, veja os guias de DeepSeek Tool Calls e Context Caching. A documentação atual de Chat Completions descreve mensagens de texto. O fato de o aplicativo móvel anunciar Vision Mode não comprova suporte de imagem na API V4. Consulte o endpoint específico antes de criar uma integração multimodal.

Como acessar o DeepSeek V4

Web e aplicativo

O V4 está disponível nos produtos oficiais de chat na web e no aplicativo. A interface pública pode apresentar modos de produto em vez dos IDs técnicos da API. Não presumimos que nomes como “Expert” e “Instant” correspondam necessariamente a Pro e Flash sem uma declaração oficial explícita. Para instalar com segurança, use o guia do DeepSeek App.

API hospedada

Use deepseek-v4-flash ou deepseek-v4-pro no campo model. A API oferece formatos compatíveis com OpenAI Chat Completions e Anthropic. Para autenticação, chamadas, streaming e segurança, consulte a documentação da DeepSeek API em português.

Pesos publicados

A DeepSeek publicou pesos e relatório técnico do V4. Execução própria exige infraestrutura compatível, runtime, segurança, monitoramento e análise da licença do checkpoint. “Pesos abertos” não significa operação simples, custo zero ou ausência de obrigações.

Migração de deepseek-chat e deepseek-reasoner

Atualização de 29 de julho de 2026: a DeepSeek anunciou que os aliases legados seriam totalmente retirados após 24 de julho de 2026, às 15:59 UTC. Esse prazo já terminou. A lista oficial atual apresenta deepseek-v4-flash e deepseek-v4-pro. Em 29/07/2026, os dois aliases ainda responderam HTTP 200 nesta conta e retornaram V4 Flash, embora ausentes de GET /models. A tabela registra o mapeamento e a migração explícita recomendada:

Alias antigoMapeamento documentado na transiçãoMigração explícita
deepseek-chatV4 Flash em Non-Thinkingdeepseek-v4-flash com Thinking desativado
deepseek-reasonerV4 Flash em Thinkingdeepseek-v4-flash com Thinking ativado

V4 Pro não é o equivalente automático de deepseek-reasoner. Durante a janela de compatibilidade, o mapeamento documentado para esse alias era V4 Flash com Thinking. Pro pode ser adotado como upgrade opcional baseado em testes.

Faça inventário de código, variáveis, dashboards, testes e documentação que ainda usam os aliases. Migre para um ID V4 explícito, consulte GET /models e rode testes de regressão antes de implantar. O teste de 29/07/2026 observou os dois aliases roteando para V4 Flash nesta conta; isso não garante continuidade.

Custo e posicionamento

V4 Flash tem tarifas menores de entrada e saída e deve ser o baseline de custo. V4 Pro custa mais e faz sentido quando uma avaliação mostra ganho suficiente por tarefa concluída. Não há uma tarifa separada apenas por ativar Thinking Mode, mas o volume de tokens pode mudar. Para valores, fórmula, cache e exemplos atualizados, acesse a página de preços do DeepSeek.

Qual versão escolher?

  • Escolha V4 Flash para construir a primeira versão, processar alto volume, resumir, extrair, classificar e responder tarefas diretas.
  • Use Flash com Thinking para raciocínio eficiente e para migrar do antigo deepseek-reasoner.
  • Teste V4 Pro em código complexo, planejamento, conhecimento difícil ou agentes em que o Flash não alcança o critério mínimo.
  • Considere pesos próprios somente se infraestrutura, licença, controle e custo total fizerem sentido.

Monte um conjunto de avaliações com casos fáceis, médios, difíceis e adversariais. Meça acurácia, taxa de aprovação humana, latência, tokens, custo, falhas de ferramenta e consistência. Veja exemplos de aplicação na página de casos de uso do DeepSeek.

Limitações e cuidados

  • O modelo pode produzir fatos, referências ou código incorretos.
  • Benchmarks publicados pelo desenvolvedor não substituem uma avaliação independente.
  • Contexto longo não garante que todo detalhe será recuperado corretamente.
  • Tool Calls exigem validação de argumentos, permissões, allowlists e confirmação para ações sensíveis.
  • Não envie segredos ou dados pessoais desnecessários.
  • Decisões médicas, jurídicas, financeiras, laborais ou de segurança precisam de profissional qualificado e revisão humana.
  • Recursos, IDs, limites e preços podem mudar durante uma fase Preview.

Perguntas frequentes

DeepSeek V4 é uma versão final?

Não é assim que o lançamento oficial atual é nomeado. A DeepSeek usa “DeepSeek-V4 Preview”.

Qual é melhor: V4 Flash ou V4 Pro?

Depende da tarefa. Flash oferece menor custo e maior capacidade de escala; Pro é a opção mais forte para demandas complexas. Comece com Flash e promova casos específicos ao Pro quando testes justificarem.

DeepSeek V4 tem 1 milhão de tokens de saída?

Não. O contexto anunciado é de 1 milhão de tokens e a saída máxima anunciada é de 384 mil, respeitando o limite total.

DeepSeek R1 foi substituído pelo V4 Pro?

Não. R1 é uma família de modelos e não é um ID atual da API hospedada. Durante a janela de compatibilidade anunciada, deepseek-reasoner foi mapeado para V4 Flash com Thinking; a lista oficial atual apresenta somente os IDs V4 explícitos. Consulte o guia do DeepSeek R1.

O V4 aceita imagens pela API?

Não inferimos isso do Vision Mode do aplicativo. Confirme o tipo de conteúdo aceito no endpoint oficial antes de implementar; a documentação atual de Chat Completions consultada descreve mensagens de texto.

Os pesos do V4 podem ser executados localmente?

A DeepSeek publicou pesos, mas “local” pode exigir infraestrutura de grande porte. Verifique model card, licença, formatos, quantização, memória e compatibilidade do runtime.

Fontes oficiais consultadas

Transparência editorial: este conteúdo é independente e não representa recomendação, parceria ou endosso oficial da DeepSeek. Informações verificadas em 29 de julho de 2026.