O DeepSeek-V4 Preview é a geração lançada pela DeepSeek em 24 de abril de 2026. A família combina contexto de até 1 milhão de tokens, Thinking e Non-Thinking Mode e duas opções hospedadas: V4 Flash, voltado à velocidade e economia, e V4 Pro, indicado para tarefas mais exigentes.
Teste controlado: V4 Flash e V4 Pro com o mesmo prompt
Executamos o mesmo prompt em português nos dois modelos, com Thinking desativado e com esforço High. O teste documenta formato, consumo e um limite de configuração; não mede qualidade geral nem estabelece vencedor.
Prompt: Compare os números decimais 9,11 e 9,8. Responda em uma única frase com o maior número.

| Modelo e modo | HTTP / fim | Resposta final | Evidência de reasoning | Entrada / saída / total |
|---|---|---|---|---|
| Flash Non-Thinking | 200 / stop | 9,8 é o maior | Ausente | 31 / 24 / 55 |
Flash Thinking High; max_tokens: 384 | 200 / stop | 9,8 é o maior | Presente; 155 tokens | 31 / 165 / 196 |
| Pro Non-Thinking | 200 / stop | 9,8 é o maior | Ausente | 31 / 11 / 42 |
Pro Thinking High; max_tokens: 384 | 200 / stop | 9,8 é o maior | Presente; 182 tokens | 31 / 192 / 223 |
Limite observado: em uma primeira rodada com
max_tokens: 128, Flash e Pro consumiram os 128 tokens em raciocínio, encerraram porlengthe deixaramcontentvazio. Ao repetir High com 384, ambos concluíram porstop. Isso é limite da configuração testada, não incapacidade do modelo.
Metodologia e limites
- Mesmo prompt e mesma data; respostas não streaming; uma chamada por condição.
- Thinking definido explicitamente como
disabledouenabledcomreasoning_effort: high. - Sem rubrica cega, repetição estatística, programação, agentes ou contexto longo.
- O raciocínio bruto não é publicado e latências isoladas não sustentam comparação de velocidade.
Detalhes de configuração em Thinking Mode; catálogo e aliases em Modelos e API.
Em 29/07/2026, deepseek-chat e deepseek-reasoner ainda responderam nesta conta e retornaram V4 Flash, mas ficaram fora de GET /models. Para código novo, use IDs V4 explícitos; veja a auditoria dos aliases.
Resposta rápida: comece com
deepseek-v4-flash. Testedeepseek-v4-procomo atualização opcional quando raciocínio, código ou agentes complexos exigirem qualidade adicional. “Preview” faz parte do nome oficial atual; esta página não apresenta o modelo como V4 Final.
Este é um guia independente em português brasileiro. Não somos a DeepSeek e não temos parceria ou endosso oficial. Especificações e disponibilidade foram conferidas em 29 de julho de 2026. Para comparar outras famílias e seus status, consulte o índice de modelos DeepSeek.
DeepSeek V4 em resumo
| Nome oficial do lançamento | DeepSeek-V4 Preview |
|---|---|
| Data de lançamento | 24 de abril de 2026 |
| Opções hospedadas | V4 Flash e V4 Pro |
| IDs atuais da API | deepseek-v4-flash e deepseek-v4-pro |
| Contexto | Até 1 milhão de tokens |
| Saída máxima anunciada | Até 384 mil tokens, dentro do contexto total |
| Modos | Thinking e Non-Thinking; Thinking ativado por padrão |
| Acesso | Web, aplicativo, API e pesos publicados |
| Interfaces da API | OpenAI Chat Completions e formato Anthropic |
V4 Flash vs V4 Pro
| Característica | DeepSeek V4 Flash | DeepSeek V4 Pro |
|---|---|---|
| ID da API | deepseek-v4-flash | deepseek-v4-pro |
| Parâmetros totais anunciados | 284 bilhões | 1,6 trilhão |
| Parâmetros ativos anunciados | 13 bilhões | 49 bilhões |
| Contexto | 1M tokens | 1M tokens |
| Saída máxima | 384K tokens | 384K tokens |
| Thinking / Non-Thinking | Sim / Sim | Sim / Sim |
| Perfil | Mais rápido, econômico e adequado à escala | Mais capacidade para tarefas complexas |
| Ponto de partida | Chat, resumo, extração, classificação e agentes simples | Raciocínio exigente, programação com agentes e tarefas avançadas |
Segundo os resultados publicados pela própria DeepSeek, o V4 Pro se destaca em conhecimento, matemática, STEM, código e tarefas agentivas. A empresa descreve o Flash como próximo do Pro em raciocínio e semelhante em tarefas simples de agentes. Esses números são benchmarks do desenvolvedor: valide ambos nos seus próprios dados antes de escolher.

Metodologia e limites desta comparação
Cruzamos o anúncio do V4 Preview, a lista atual de modelos, a tabela de preços, os limites de concorrência e o guia de Thinking Mode, todos consultados em 29 de julho de 2026. A diferença de aproximadamente 68% no preço sem cache e na saída é um cálculo local sobre as tarifas publicadas; a concorrência de 2.500 contra 500 é um limite padrão por conta documentado, não uma medição de velocidade.
Limite do teste: fizemos chamadas autenticadas pontuais a Flash e Pro em Non-Thinking e Thinking High; também repetimos a condição Thinking depois de observar o limite de max_tokens: 128. Não reproduzimos os benchmarks da fabricante nem executamos uma avaliação estatística de qualidade, latência ou taxa de sucesso. Portanto, estes resultados registram somente as configurações e respostas observadas nesta conta em 29 de julho de 2026. Uma comparação de qualidade exige prompts fixos, várias repetições, rubrica cega e publicação dos dados brutos.
O que mudou na arquitetura?
A DeepSeek descreve V4 como um modelo Mixture-of-Experts com grande diferença entre parâmetros totais e ativos por token. O lançamento também apresenta duas técnicas centrais:
- DeepSeek Sparse Attention (DSA): mecanismo de atenção esparsa criado para lidar com contexto longo com mais eficiência.
- Token-wise compression: técnica de compressão citada pela DeepSeek em conjunto com DSA para melhorar a eficiência do contexto; os detalhes da implementação estão no relatório técnico.
Essas características ajudam a explicar a janela de contexto extensa, mas não garantem precisão em qualquer documento longo. A qualidade ainda depende de instruções, posição da evidência, ruído, idioma, formato e critérios de avaliação.
Contexto de 1 milhão de tokens: o que significa?
A janela de contexto reúne entrada e saída dentro do limite aceito pelo serviço. A saída máxima anunciada é de 384 mil tokens, portanto “1M de contexto” não significa que toda resposta possa ter 1 milhão de tokens.
- Documentos maiores ainda precisam de limpeza, estrutura e seleção de trechos relevantes.
- RAG continua útil quando a base muda, precisa de citações ou possui controle de acesso.
- Enviar mais conteúdo aumenta latência, custo e superfície para instruções maliciosas.
- Teste recuperação de fatos distribuídos no início, meio e fim do contexto.
Uma janela longa não elimina a necessidade de engenharia de contexto, recuperação, validação ou revisão humana.
Thinking e Non-Thinking Mode
Os dois modelos funcionam em dois modos. O Thinking Mode está ativado por padrão e retorna o raciocínio em reasoning_content, separado da resposta final em content. Na interface OpenAI, reasoning_effort aceita high ou max.
| Modo | Quando usar | Observação |
|---|---|---|
| Thinking | Problemas com várias etapas, análise, código e planejamento | temperature, top_p, presence_penalty e frequency_penalty são aceitos apenas por compatibilidade e não produzem efeito no modo atual |
| Non-Thinking | Respostas diretas, extração, classificação e menor latência | Permite recursos como FIM Completion |
Ao combinar Thinking Mode e Tool Calls, devolva integralmente o reasoning_content da mensagem do assistente em todas as requisições subsequentes desse fluxo. Se ele não for reenviado corretamente, a API pode retornar HTTP 400. Veja os parâmetros e exemplos corretos no guia de Thinking Mode.
Recursos disponíveis na API
| Recurso | V4 Flash | V4 Pro | Nota |
|---|---|---|---|
| JSON Output | Sim | Sim | Valide sempre o JSON recebido |
| Tool Calls | Sim | Sim | O backend executa e autoriza a ferramenta |
| Chat Prefix Completion | Sim | Sim | Recurso Beta |
| FIM Completion | Sim | Sim | Somente em Non-Thinking Mode |
| Context Caching | Sim | Sim | Automático e de melhor esforço |
Para implementação, veja os guias de DeepSeek Tool Calls e Context Caching. A documentação atual de Chat Completions descreve mensagens de texto. O fato de o aplicativo móvel anunciar Vision Mode não comprova suporte de imagem na API V4. Consulte o endpoint específico antes de criar uma integração multimodal.
Como acessar o DeepSeek V4
Web e aplicativo
O V4 está disponível nos produtos oficiais de chat na web e no aplicativo. A interface pública pode apresentar modos de produto em vez dos IDs técnicos da API. Não presumimos que nomes como “Expert” e “Instant” correspondam necessariamente a Pro e Flash sem uma declaração oficial explícita. Para instalar com segurança, use o guia do DeepSeek App.
API hospedada
Use deepseek-v4-flash ou deepseek-v4-pro no campo model. A API oferece formatos compatíveis com OpenAI Chat Completions e Anthropic. Para autenticação, chamadas, streaming e segurança, consulte a documentação da DeepSeek API em português.
Pesos publicados
A DeepSeek publicou pesos e relatório técnico do V4. Execução própria exige infraestrutura compatível, runtime, segurança, monitoramento e análise da licença do checkpoint. “Pesos abertos” não significa operação simples, custo zero ou ausência de obrigações.
Migração de deepseek-chat e deepseek-reasoner
Atualização de 29 de julho de 2026: a DeepSeek anunciou que os aliases legados seriam totalmente retirados após 24 de julho de 2026, às 15:59 UTC. Esse prazo já terminou. A lista oficial atual apresenta deepseek-v4-flash e deepseek-v4-pro. Em 29/07/2026, os dois aliases ainda responderam HTTP 200 nesta conta e retornaram V4 Flash, embora ausentes de GET /models. A tabela registra o mapeamento e a migração explícita recomendada:
| Alias antigo | Mapeamento documentado na transição | Migração explícita |
|---|---|---|
deepseek-chat | V4 Flash em Non-Thinking | deepseek-v4-flash com Thinking desativado |
deepseek-reasoner | V4 Flash em Thinking | deepseek-v4-flash com Thinking ativado |
V4 Pro não é o equivalente automático de deepseek-reasoner. Durante a janela de compatibilidade, o mapeamento documentado para esse alias era V4 Flash com Thinking. Pro pode ser adotado como upgrade opcional baseado em testes.
Faça inventário de código, variáveis, dashboards, testes e documentação que ainda usam os aliases. Migre para um ID V4 explícito, consulte GET /models e rode testes de regressão antes de implantar. O teste de 29/07/2026 observou os dois aliases roteando para V4 Flash nesta conta; isso não garante continuidade.
Custo e posicionamento
V4 Flash tem tarifas menores de entrada e saída e deve ser o baseline de custo. V4 Pro custa mais e faz sentido quando uma avaliação mostra ganho suficiente por tarefa concluída. Não há uma tarifa separada apenas por ativar Thinking Mode, mas o volume de tokens pode mudar. Para valores, fórmula, cache e exemplos atualizados, acesse a página de preços do DeepSeek.
Qual versão escolher?
- Escolha V4 Flash para construir a primeira versão, processar alto volume, resumir, extrair, classificar e responder tarefas diretas.
- Use Flash com Thinking para raciocínio eficiente e para migrar do antigo
deepseek-reasoner. - Teste V4 Pro em código complexo, planejamento, conhecimento difícil ou agentes em que o Flash não alcança o critério mínimo.
- Considere pesos próprios somente se infraestrutura, licença, controle e custo total fizerem sentido.
Monte um conjunto de avaliações com casos fáceis, médios, difíceis e adversariais. Meça acurácia, taxa de aprovação humana, latência, tokens, custo, falhas de ferramenta e consistência. Veja exemplos de aplicação na página de casos de uso do DeepSeek.
Limitações e cuidados
- O modelo pode produzir fatos, referências ou código incorretos.
- Benchmarks publicados pelo desenvolvedor não substituem uma avaliação independente.
- Contexto longo não garante que todo detalhe será recuperado corretamente.
- Tool Calls exigem validação de argumentos, permissões, allowlists e confirmação para ações sensíveis.
- Não envie segredos ou dados pessoais desnecessários.
- Decisões médicas, jurídicas, financeiras, laborais ou de segurança precisam de profissional qualificado e revisão humana.
- Recursos, IDs, limites e preços podem mudar durante uma fase Preview.
Perguntas frequentes
DeepSeek V4 é uma versão final?
Não é assim que o lançamento oficial atual é nomeado. A DeepSeek usa “DeepSeek-V4 Preview”.
Qual é melhor: V4 Flash ou V4 Pro?
Depende da tarefa. Flash oferece menor custo e maior capacidade de escala; Pro é a opção mais forte para demandas complexas. Comece com Flash e promova casos específicos ao Pro quando testes justificarem.
DeepSeek V4 tem 1 milhão de tokens de saída?
Não. O contexto anunciado é de 1 milhão de tokens e a saída máxima anunciada é de 384 mil, respeitando o limite total.
DeepSeek R1 foi substituído pelo V4 Pro?
Não. R1 é uma família de modelos e não é um ID atual da API hospedada. Durante a janela de compatibilidade anunciada, deepseek-reasoner foi mapeado para V4 Flash com Thinking; a lista oficial atual apresenta somente os IDs V4 explícitos. Consulte o guia do DeepSeek R1.
O V4 aceita imagens pela API?
Não inferimos isso do Vision Mode do aplicativo. Confirme o tipo de conteúdo aceito no endpoint oficial antes de implementar; a documentação atual de Chat Completions consultada descreve mensagens de texto.
Os pesos do V4 podem ser executados localmente?
A DeepSeek publicou pesos, mas “local” pode exigir infraestrutura de grande porte. Verifique model card, licença, formatos, quantização, memória e compatibilidade do runtime.
Fontes oficiais consultadas
- Anúncio oficial do DeepSeek-V4 Preview
- Models & Pricing — especificações atuais
- Thinking Mode — comportamento e parâmetros
- List Models — IDs disponibilizados pela API
- Organização da DeepSeek no Hugging Face
Transparência editorial: este conteúdo é independente e não representa recomendação, parceria ou endosso oficial da DeepSeek. Informações verificadas em 29 de julho de 2026.