DeepSeek V4 é a família hospedada atual. Em 23/08/2026, ela inclui deepseek-v4-flash, deepseek-v4-pro e o experimental deepseek-v4-flash-vision-exp. Flash e Pro recebem texto; Vision Exp recebe texto e imagens.
Atualização documental — 23 de agosto de 2026. A família hospedada atual inclui
deepseek-v4-flash,deepseek-v4-proe o experimentaldeepseek-v4-flash-vision-exp. Os três funcionam em Chat Completions, Responses API e Anthropic API. Flash e Pro recebem texto; Vision Exp recebe texto e imagens. Os testes publicados nesta página antes de 21/08/2026 continuam válidos apenas como retratos históricos dos modelos, preços e protocolos registrados em cada data.
Teste controlado: V4 Flash e V4 Pro com o mesmo prompt
Executamos o mesmo prompt em português nos dois modelos, com Thinking desativado e com esforço High. O teste documenta formato, consumo e um limite de configuração; não mede qualidade geral nem estabelece vencedor.
Prompt: Compare os números decimais 9,11 e 9,8. Responda em uma única frase com o maior número.

| Modelo e modo | HTTP / fim | Resposta final | Evidência de reasoning | Entrada / saída / total |
|---|---|---|---|---|
| Flash Non-Thinking | 200 / stop | 9,8 é o maior | Ausente | 31 / 24 / 55 |
Flash Thinking High; max_tokens: 384 | 200 / stop | 9,8 é o maior | Presente; 155 tokens | 31 / 165 / 196 |
| Pro Non-Thinking | 200 / stop | 9,8 é o maior | Ausente | 31 / 11 / 42 |
Pro Thinking High; max_tokens: 384 | 200 / stop | 9,8 é o maior | Presente; 182 tokens | 31 / 192 / 223 |
Limite observado: em uma primeira rodada com
max_tokens: 128, Flash e Pro consumiram os 128 tokens em raciocínio, encerraram porlengthe deixaramcontentvazio. Ao repetir High com 384, ambos concluíram porstop. Isso é limite da configuração testada, não incapacidade do modelo.
Metodologia e limites
- Mesmo prompt e mesma data; respostas não streaming; uma chamada por condição.
- Thinking definido explicitamente como
disabledouenabledcomreasoning_effort: high. - Sem rubrica cega, repetição estatística, programação, agentes ou contexto longo.
- O raciocínio bruto não é publicado e latências isoladas não sustentam comparação de velocidade.
Detalhes de configuração em Thinking Mode; catálogo e aliases em Modelos e API.
Retrato histórico: os testes desta página foram executados antes do lançamento do
DeepSeek-V4-Pro-0813em 13/08/2026. Eles preservam o comportamento observado na data e no protocolo indicados, mas não avaliam a versão hospedada atual do Pro.
Evidência independente em português brasileiro
Em 8 de agosto de 2026, ampliamos a verificação para 72 chamadas autenticadas, com 12 tarefas em português brasileiro e três repetições por modelo. O Flash obteve 30/36 aprovações estritas e 66/72 pontos; o Pro, 32/36 e 68/72. Não houve falha crítica. Na mesma janela, o Pro custou cerca de 3,2 vezes o Flash e teve latência mediana 28,4% maior.
Dois acertos formais a mais não tornam o Pro um vencedor universal. Escolha pelo seu corpus, limite de latência e orçamento — não apenas pelo nome do modelo. Veja o teste completo do DeepSeek V4 em português no Brasil, com prompts, respostas brutas, protocolo, revisão dos validadores e arquivos para reprodução.
Em 29/07/2026, deepseek-chat e deepseek-reasoner ainda responderam nesta conta e retornaram V4 Flash, mas ficaram fora de GET /models. Para código novo, use IDs V4 explícitos; veja a auditoria dos aliases.
Resposta rápida: comece com
deepseek-v4-flash. Testedeepseek-v4-procomo atualização opcional quando raciocínio, código ou agentes complexos exigirem qualidade adicional. “Preview” descreve o lançamento histórico de abril; o estado hospedado atual é Flash-0731 beta e Pro-0813 GA.
Este é um guia independente em português brasileiro. Não somos a DeepSeek e não temos parceria ou endosso oficial. Especificações e disponibilidade foram rechecadas em 24 de agosto de 2026; os testes históricos de 29 de julho e 8 de agosto permanecem datados. Para comparar outras famílias e seus status, consulte o índice de modelos DeepSeek.
Para entender onde o V4 se encaixa entre chat, aplicativo e API, consulte o guia geral do DeepSeek no Brasil.
DeepSeek V4 em resumo
| Aspecto | Estado atual |
|---|---|
| IDs hospedados | deepseek-v4-flash, deepseek-v4-pro, deepseek-v4-flash-vision-exp |
| Entrada | Texto em Flash/Pro; texto e imagens no Vision Exp |
| Contexto | Até 1M tokens |
| Saída máxima | Até 384K tokens, dentro do contexto total |
| Modos | Thinking e Non-Thinking; Thinking ativado por padrão |
| Interfaces | Chat Completions, Responses API e Anthropic API |
| Imagens | JPEG, PNG, GIF e WebP; somente no Vision Exp |
| Files API | Upload e reutilização de imagens por file_id; não é PDF/RAG gerenciado |
V4 Flash, V4 Pro e Vision Exp
| Característica | V4 Flash | V4 Pro | V4 Flash Vision Exp |
|---|---|---|---|
| ID | deepseek-v4-flash | deepseek-v4-pro | deepseek-v4-flash-vision-exp |
| Entrada | Texto | Texto | Texto e imagens |
| Estado | Beta público | GA | Experimental |
| Contexto / saída máx. | 1M / 384K | 1M / 384K | 1M / 384K |
| Thinking / Non-Thinking | Sim | Sim | Sim |
| JSON Output / Tool Calls | Sim / Sim | Sim / Sim | Sim / Sim |
| Responses / Anthropic | Sim / Sim | Sim / Sim | Sim / Sim |
| FIM Completion | Non-Thinking | Non-Thinking | Não suportado |
| Concorrência padrão | 2.500 | 500 | 2.500 |
| Perfil inicial | Custo e escala | Tarefas complexas | Compreensão visual experimental |
Segundo os resultados publicados pela própria DeepSeek, o V4 Pro se destaca em conhecimento, matemática, STEM, código e tarefas agentivas. A empresa descreve o Flash como próximo do Pro em raciocínio. Esses números são benchmarks do fornecedor; valide os modelos nos seus próprios dados.
Como funciona o Vision Exp
deepseek-v4-flash-vision-exp aceita imagens junto com texto. A documentação mostra três formas de entrada: Base64, URL HTTP(S) pública ou file_id obtido pela Files API. Em Chat Completions, use blocos text, image_url ou file; em Responses, use input_image; no formato Anthropic, use um bloco image.
Os formatos aceitos são JPEG, PNG, GIF e WebP. Imagens inline ou por URL têm limite de 32 MiB por imagem; por file_id, até 64 MiB. O máximo documentado é 600 imagens por requisição. Imagens são convertidas em tokens e cobradas como entrada.
Para conhecer as famílias multimodais anteriores com pesos para execução própria, veja DeepSeek VL e DeepSeek-VL2. Elas não são aliases nem versões locais do Vision Exp hospedado.
Files API: escopo correto
A Files API permite enviar imagens uma vez e reutilizá-las por file_id. Ela oferece criação, listagem, consulta e exclusão, com até 64 MiB por upload, 25 GiB de armazenamento por usuário e até 10 mil arquivos armazenados.
Esse recurso não extrai PDFs, não cria embeddings, não oferece vector store e não monta uma base RAG. Para documentos textuais ou uma base de conhecimento, a aplicação ainda precisa extrair, segmentar, indexar, controlar acesso e validar respostas.
Limite temporal: os testes Flash/Pro abaixo foram realizados antes do lançamento do Vision Exp e não avaliam visão, OCR, Files API nem o modelo experimental.

Metodologia e limites desta comparação
Cruzamos o anúncio do V4 Preview, a lista atual de modelos, a tabela de preços, os limites de concorrência e o guia de Thinking Mode, todos consultados em 29 de julho de 2026. A diferença de aproximadamente 68% no preço sem cache e na saída é um cálculo local sobre as tarifas publicadas; a concorrência de 2.500 contra 500 é um limite padrão por conta documentado, não uma medição de velocidade.
Limite do teste: fizemos chamadas autenticadas pontuais a Flash e Pro em Non-Thinking e Thinking High; também repetimos a condição Thinking depois de observar o limite de max_tokens: 128. Não reproduzimos os benchmarks da fabricante nem executamos uma avaliação estatística de qualidade, latência ou taxa de sucesso. Portanto, estes resultados registram somente as configurações e respostas observadas nesta conta em 29 de julho de 2026. Uma comparação de qualidade exige prompts fixos, várias repetições, rubrica cega e publicação dos dados brutos.
O que mudou na arquitetura?
A DeepSeek descreve V4 como um modelo Mixture-of-Experts com grande diferença entre parâmetros totais e ativos por token. O lançamento também apresenta duas técnicas centrais:
- DeepSeek Sparse Attention (DSA): mecanismo de atenção esparsa criado para lidar com contexto longo com mais eficiência.
- Token-wise compression: técnica de compressão citada pela DeepSeek em conjunto com DSA para melhorar a eficiência do contexto; os detalhes da implementação estão no relatório técnico.
Essas características ajudam a explicar a janela de contexto extensa, mas não garantem precisão em qualquer documento longo. A qualidade ainda depende de instruções, posição da evidência, ruído, idioma, formato e critérios de avaliação.
Contexto de 1 milhão de tokens: o que significa?
A janela de contexto reúne entrada e saída dentro do limite aceito pelo serviço. A saída máxima anunciada é de 384 mil tokens, portanto “1M de contexto” não significa que toda resposta possa ter 1 milhão de tokens.
- Documentos maiores ainda precisam de limpeza, estrutura e seleção de trechos relevantes.
- RAG continua útil quando a base muda, precisa de citações ou possui controle de acesso.
- Enviar mais conteúdo aumenta latência, custo e superfície para instruções maliciosas.
- Teste recuperação de fatos distribuídos no início, meio e fim do contexto.
Uma janela longa não elimina a necessidade de engenharia de contexto, recuperação, validação ou revisão humana.
Em um estudo separado, publicamos um teste reproduzível do V4 com documentos longos em português, com resultados até 512 mil tokens e limites explícitos.
Thinking e Non-Thinking Mode
Os três modelos hospedados funcionam em Thinking e Non-Thinking Mode. O Thinking Mode está ativado por padrão e retorna o raciocínio em reasoning_content, separado da resposta final em content. Na interface OpenAI, reasoning_effort aceita low, high ou max.
| Modo | Quando usar | Observação |
|---|---|---|
| Thinking | Problemas com várias etapas, análise, código e planejamento | temperature, top_p, presence_penalty e frequency_penalty são aceitos apenas por compatibilidade e não produzem efeito no modo atual |
| Non-Thinking | Respostas diretas, extração, classificação e menor latência | Permite recursos como FIM Completion |
Ao combinar Thinking Mode e Tool Calls, devolva integralmente o reasoning_content da mensagem do assistente em todas as requisições subsequentes desse fluxo. Se ele não for reenviado corretamente, a API pode retornar HTTP 400. Veja os parâmetros e exemplos corretos no guia de Thinking Mode.
Recursos disponíveis na API
| Recurso | Flash | Pro | Vision Exp | Observação |
|---|---|---|---|---|
| Texto | Sim | Sim | Sim | — |
| Imagens | Não | Não | Sim | JPEG, PNG, GIF e WebP |
| JSON Output | Sim | Sim | Sim | Valide o JSON recebido |
| Tool Calls | Sim | Sim | Sim | A aplicação autoriza e executa |
| Responses API | Sim | Sim | Sim | Imagens somente no Vision Exp |
| Anthropic API | Sim | Sim | Sim | O formato dos blocos difere |
| Chat Prefix Completion | Sim | Sim | Sim | Beta |
| FIM Completion | Non-Thinking | Non-Thinking | Não | — |
| Context Caching | Sim | Sim | Sim | Automático e best effort |
Para implementação, veja os guias de DeepSeek API, Vision e Files API.
Como acessar o DeepSeek V4
Web e aplicativo
O V4 está disponível nos produtos oficiais de chat na web e no aplicativo. A interface pública pode apresentar modos de produto em vez dos IDs técnicos da API. Não presumimos que nomes como “Expert” e “Instant” correspondam necessariamente a Pro e Flash sem uma declaração oficial explícita. Para instalar com segurança, use o guia do DeepSeek App.
API hospedada
Use deepseek-v4-flash ou deepseek-v4-pro para entrada textual. Use deepseek-v4-flash-vision-exp quando a tarefa realmente precisar de imagens e puder aceitar um modelo experimental. A API mantém base URL compatível com OpenAI e um endpoint Anthropic-compatible; compatibilidade de formato não significa que todo recurso de outro provedor exista.
Pesos publicados
A DeepSeek publicou pesos e relatório técnico do V4. Execução própria exige infraestrutura compatível, runtime, segurança, monitoramento e análise da licença do checkpoint. “Pesos abertos” não significa operação simples, custo zero ou ausência de obrigações.
Migração de deepseek-chat e deepseek-reasoner
Atualização de 29 de julho de 2026: a DeepSeek anunciou que os aliases legados seriam totalmente retirados após 24 de julho de 2026, às 15:59 UTC. Esse prazo já terminou. A lista oficial atual apresenta deepseek-v4-flash e deepseek-v4-pro. Em 29/07/2026, os dois aliases ainda responderam HTTP 200 nesta conta e retornaram V4 Flash, embora ausentes de GET /models. A tabela registra o mapeamento e a migração explícita recomendada:
| Alias antigo | Mapeamento documentado na transição | Migração explícita |
|---|---|---|
deepseek-chat | V4 Flash em Non-Thinking | deepseek-v4-flash com Thinking desativado |
deepseek-reasoner | V4 Flash em Thinking | deepseek-v4-flash com Thinking ativado |
V4 Pro não é o equivalente automático de deepseek-reasoner. Durante a janela de compatibilidade, o mapeamento documentado para esse alias era V4 Flash com Thinking. Pro pode ser adotado como upgrade opcional baseado em testes.
Faça inventário de código, variáveis, dashboards, testes e documentação que ainda usam os aliases. Migre para um ID V4 explícito, consulte GET /models e rode testes de regressão antes de implantar. O teste de 29/07/2026 observou os dois aliases roteando para V4 Flash nesta conta; isso não garante continuidade.
Custo e posicionamento
| Modelo | Período | Cache hit | Cache miss | Saída |
|---|---|---|---|---|
| Flash / Vision Exp | Fora de pico | US$ 0,007 | US$ 0,22 | US$ 0,66 |
| Flash / Vision Exp | Pico | US$ 0,014 | US$ 0,44 | US$ 1,32 |
| Pro | Fora de pico | US$ 0,022 | US$ 0,66 | US$ 1,98 |
| Pro | Pico | US$ 0,044 | US$ 1,32 | US$ 3,96 |
O pico ocorre das 01:00 às 04:00 UTC e das 06:00 às 10:00 UTC, de segunda a sexta-feira; todos os demais horários são fora de pico. Confirme a página de preços antes de estimar produção.
Qual versão escolher?
- Escolha V4 Flash para construir a primeira versão, processar alto volume, resumir, extrair, classificar e responder tarefas diretas.
- Use Flash com Thinking para raciocínio eficiente e para migrar do antigo
deepseek-reasoner. - Teste V4 Pro em código complexo, planejamento, conhecimento difícil ou agentes em que o Flash não alcança o critério mínimo.
- Considere pesos próprios somente se infraestrutura, licença, controle e custo total fizerem sentido.
Monte um conjunto de avaliações com casos fáceis, médios, difíceis e adversariais. Meça acurácia, taxa de aprovação humana, latência, tokens, custo, falhas de ferramenta e consistência. Veja exemplos de aplicação na página de casos de uso do DeepSeek.
Limitações e cuidados
- O modelo pode produzir fatos, referências ou código incorretos.
- Benchmarks publicados pelo desenvolvedor não substituem uma avaliação independente.
- Contexto longo não garante que todo detalhe será recuperado corretamente.
- Tool Calls exigem validação de argumentos, permissões, allowlists e confirmação para ações sensíveis.
- Não envie segredos ou dados pessoais desnecessários.
- Decisões médicas, jurídicas, financeiras, laborais ou de segurança precisam de profissional qualificado e revisão humana.
- Recursos, versões, limites e preços podem mudar; registre a data de cada verificação.
Perguntas frequentes
DeepSeek V4 é uma versão final?
O lançamento de abril conserva o nome histórico “DeepSeek-V4 Preview”. O estado hospedado atual é mais específico: Flash-0731 permanece em beta público e Pro-0813 está em disponibilidade geral.
Qual é melhor: V4 Flash ou V4 Pro?
Depende da tarefa. Flash oferece menor custo e maior capacidade de escala; Pro é a opção mais forte para demandas complexas. Comece com Flash e promova casos específicos ao Pro quando testes justificarem.
DeepSeek V4 tem 1 milhão de tokens de saída?
Não. O contexto anunciado é de 1 milhão de tokens e a saída máxima anunciada é de 384 mil, respeitando o limite total.
DeepSeek R1 foi substituído pelo V4 Pro?
Não. R1 é uma família de modelos e não é um ID atual da API hospedada. Durante a janela de compatibilidade anunciada, deepseek-reasoner foi mapeado para V4 Flash com Thinking; a lista oficial atual apresenta somente os IDs V4 explícitos. Consulte o guia do DeepSeek R1.
O V4 aceita imagens pela API?
Sim, mas somente por meio do modelo experimental deepseek-v4-flash-vision-exp. deepseek-v4-flash e deepseek-v4-pro continuam sendo opções de entrada textual. O Vision Exp aceita JPEG, PNG, GIF e WebP em Chat Completions, Responses e Anthropic, por Base64, URL pública ou file_id.
Os pesos do V4 podem ser executados localmente?
A DeepSeek publicou pesos, mas “local” pode exigir infraestrutura de grande porte. Verifique model card, licença, formatos, quantização, memória e compatibilidade do runtime.
Fontes oficiais consultadas
- Anúncio oficial do DeepSeek-V4 Preview
- Models & Pricing — especificações atuais
- Thinking Mode — comportamento e parâmetros
- List Models — IDs disponibilizados pela API
- Organização da DeepSeek no Hugging Face
Transparência editorial: este conteúdo é independente e não representa recomendação, parceria ou endosso oficial da DeepSeek. Informações verificadas documentalmente em 24 de agosto de 2026; os testes permanecem datados de 29 de julho e 8 de agosto de 2026.