Atualização verificada em 23 de agosto de 2026. O chat e o aplicativo oficial continuam separados da API, que é cobrada por tokens. As tarifas de pico e fora de pico estão em vigor desde 16/08/2026, às 16:00 UTC. O pico ocorre das 01:00 às 04:00 UTC e das 06:00 às 10:00 UTC, de segunda a sexta-feira; todos os demais horários são fora de pico. Esta página preserva os testes históricos com os preços da data da coleta e apresenta separadamente a tabela vigente.
Registro histórico: os custos observados nas chamadas de 29/07/2026 foram calculados com as tarifas vigentes na data da coleta. Eles não foram recalculados retroativamente com a tabela que entra em vigor em 16/08/2026.
Teste real de custo: duas chamadas idênticas
Em 29 de julho de 2026, enviamos duas requisições autenticadas e byte a byte idênticas com deepseek-v4-flash, Thinking desativado e um corpo JSON de 4.699 bytes. A segunda foi enviada 15 segundos depois.

| Chamada | Cache hit | Cache miss | Output | Custo calculado |
|---|---|---|---|---|
| Primeira | 0 | 1.294 | 1 | US$ 0,00018144 |
| Segunda | 1.280 | 14 | 1 | US$ 0,000005824 |
Primeira = (1.294 ÷ 1.000.000 × US$ 0,14) + (1 ÷ 1.000.000 × US$ 0,28) = US$ 0,00018144
Segunda = (1.280 ÷ 1.000.000 × US$ 0,0028) + (14 ÷ 1.000.000 × US$ 0,14) + (1 ÷ 1.000.000 × US$ 0,28) = US$ 0,000005824
Nesta amostra, o custo calculado da segunda chamada foi 96,79% menor. O cache é best-effort; isso não promete a mesma economia em outras cargas. Impostos, câmbio, infraestrutura e conferência de fatura não entram no cálculo.
Veja a metodologia completa do cache, a leitura de Token Usage e a tabela oficial de preços.
Registro encerrado: a primeira tabela abaixo valeu somente até 16/08/2026, às 15:59 UTC. Ela explica os cálculos históricos desta página, mas não deve ser usada em novos orçamentos. Para estimativas atuais, use a tabela “Tarifas vigentes” e aplique a faixa horária correspondente.
Este é um guia editorial independente em português. Não somos a DeepSeek, não vendemos créditos e não representamos um canal oficial da empresa. Preços, limites e condições podem mudar; confirme os valores oficiais antes de recarregar saldo ou aprovar um orçamento.
Antes de comparar custos, veja a comparação entre chat, app, API e execução local, pois cada forma de acesso tem cobrança e responsabilidades diferentes.
O DeepSeek é gratuito ou pago?
Depende da forma de acesso. Na verificação de 5 de agosto de 2026, o chat oficial era apresentado com acesso gratuito, sujeito às condições e aos limites do serviço. Isso não torna todos os produtos gratuitos: a API oficial é separada e mede tokens de entrada e saída.
Na API, o valor é descontado do saldo recarregado ou concedido; quando os dois existem, a documentação informa que o saldo concedido é usado primeiro. Receber crédito não altera a tarifa nem garante novos créditos. Para acompanhar o consumo, use o campo usage e consulte o estudo de tokens em português brasileiro.
| Forma de acesso | Como funciona o preço | Uso mais comum |
|---|---|---|
| Chat oficial no navegador | Acesso gratuito disponível na data da revisão; limites e recursos podem variar | Conversas e tarefas manuais |
| Aplicativo oficial | Download e acesso listados como gratuitos; condições podem mudar | Uso pessoal em Android, iPhone e iPad |
| API oficial | Paga por tokens efetivamente processados | Aplicativos, integrações, agentes e automações |
| Pesos abertos | Sem tarifa por token da API oficial, mas com custos próprios de hardware, nuvem, operação e equipe | Pesquisa, personalização e implantação própria |
O acesso gratuito ao chat ou ao DeepSeek App não inclui créditos ilimitados de API. Da mesma forma, baixar pesos de um modelo não torna a infraestrutura necessária para executá-lo gratuita.
Tarifas válidas até 16/08/2026, 15:59 UTC
Os valores são expressos em dólares americanos por 1 milhão de tokens. A entrada é dividida entre tokens que obtiveram acerto no cache e tokens sem acerto. A saída usa uma tarifa própria.
| Modelo no período histórico | Entrada: cache hit | Entrada: cache miss | Saída |
|---|---|---|---|
deepseek-v4-flash | US$ 0,0028 / 1M | US$ 0,14 / 1M | US$ 0,28 / 1M |
deepseek-v4-pro | US$ 0,003625 / 1M | US$ 0,435 / 1M | US$ 0,87 / 1M |
Tarifas vigentes desde 16/08/2026, 16:00 UTC
Valores em dólares americanos por 1 milhão de tokens.
| Modelo e período | Entrada: cache hit | Entrada: cache miss | Saída |
|---|---|---|---|
| V4 Flash — fora de pico | US$ 0,007 | US$ 0,22 | US$ 0,66 |
| V4 Flash — pico | US$ 0,014 | US$ 0,44 | US$ 1,32 |
| V4 Pro — fora de pico | US$ 0,022 | US$ 0,66 | US$ 1,98 |
| V4 Pro — pico | US$ 0,044 | US$ 1,32 | US$ 3,96 |
| V4 Flash Vision Exp — fora de pico | US$ 0,007 | US$ 0,22 | US$ 0,66 |
| V4 Flash Vision Exp — pico | US$ 0,014 | US$ 0,44 | US$ 1,32 |
O pico ocorre das 01:00 às 04:00 UTC e das 06:00 às 10:00 UTC, de segunda a sexta-feira; todos os demais horários são fora de pico.
Imagens enviadas ao deepseek-v4-flash-vision-exp são convertidas em tokens conforme suas dimensões e cobradas como tokens de entrada junto com o texto. O modelo Vision Exp tem a mesma tarifa do V4 Flash.
Exemplo com 1 milhão de tokens de entrada sem cache e 500 mil de saída: Flash ou Vision Exp custa US$ 0,55 fora de pico ou US$ 1,10 no pico; Pro custa US$ 1,65 fora de pico ou US$ 3,30 no pico. Os totais não incluem impostos, câmbio, infraestrutura ou outros fornecedores.
V4 Flash é a opção econômica para texto. Vision Exp usa a mesma tarifa quando a tarefa exige imagens. V4 Pro é uma atualização opcional para tarefas em que o ganho de qualidade compensa o custo maior. Conheça as diferenças no guia do DeepSeek V4.
Preço por mil e por 100 mil tokens
A cobrança não exige lotes exatos de 1 milhão. As conversões abaixo usam a tarifa vigente e, por isso, separam pico e fora de pico.
| Modelo, período e token | Por 1 mil tokens | Por 100 mil tokens |
|---|---|---|
| Flash / Vision — fora de pico — cache hit | US$ 0,000007 | US$ 0,0007 |
| Flash / Vision — fora de pico — cache miss | US$ 0,00022 | US$ 0,022 |
| Flash / Vision — fora de pico — saída | US$ 0,00066 | US$ 0,066 |
| Flash / Vision — pico — cache hit | US$ 0,000014 | US$ 0,0014 |
| Flash / Vision — pico — cache miss | US$ 0,00044 | US$ 0,044 |
| Flash / Vision — pico — saída | US$ 0,00132 | US$ 0,132 |
| Pro — fora de pico — cache hit | US$ 0,000022 | US$ 0,0022 |
| Pro — fora de pico — cache miss | US$ 0,00066 | US$ 0,066 |
| Pro — fora de pico — saída | US$ 0,00198 | US$ 0,198 |
| Pro — pico — cache hit | US$ 0,000044 | US$ 0,0044 |
| Pro — pico — cache miss | US$ 0,00132 | US$ 0,132 |
| Pro — pico — saída | US$ 0,00396 | US$ 0,396 |
Como calcular o custo da API
A conta inclui três parcelas:
Custo =
(tokens de entrada com cache ÷ 1.000.000 × tarifa de cache hit)
+ (tokens de entrada sem cache ÷ 1.000.000 × tarifa de cache miss)
+ (tokens de saída ÷ 1.000.000 × tarifa de saída)
Use os números retornados no campo usage da resposta da API para conferir a cobrança. Uma estimativa baseada apenas em caracteres, palavras ou páginas pode divergir da tokenização real.

Três cenários reproduzíveis do infográfico
| Cenário agregado | V4 Flash | V4 Pro |
|---|---|---|
| A: 100 mil tokens sem cache + 20 mil de saída | US$ 0,0196 | US$ 0,0609 |
| B: 8 milhões com cache + 2 milhões sem cache + 1 milhão de saída | US$ 0,5824 | US$ 1,769 |
| C: 1 milhão sem cache + 250 mil de saída | US$ 0,21 | US$ 0,6525 |
O cenário B representa um lote de requisições, não uma única janela de 11 milhões de tokens. Você pode reproduzir cada total substituindo os três volumes na fórmula acima. Mantivemos todas as casas decimais produzidas pela multiplicação e não arredondamos para centavos antes de somar.
Metodologia atualizada: tarifas conferidas na fonte oficial em 29 de julho de 2026 e cálculos refeitos com campos usage de chamadas autenticadas. Não houve conferência de fatura; impostos, câmbio, taxas de pagamento e infraestrutura não entram nos totais.
Exemplo 1: V4 Flash sem acerto de cache
Em um conjunto de requisições, a carga soma 1 milhão de tokens de entrada sem cache e 500 mil tokens de saída. Esses valores são agregados e não descrevem uma única requisição, pois a saída máxima anunciada é de 384 mil tokens.
Fora de pico
- Entrada: 1 × US$ 0,22 = US$ 0,22.
- Saída: 0,5 × US$ 0,66 = US$ 0,33.
- Total estimado: US$ 0,55.
Pico
- Entrada: 1 × US$ 0,44 = US$ 0,44.
- Saída: 0,5 × US$ 1,32 = US$ 0,66.
- Total estimado: US$ 1,10.
O deepseek-v4-flash-vision-exp usa as mesmas tarifas. Em uma solicitação com imagem, some também os tokens de imagem contabilizados como entrada.
Exemplo 2: a mesma carga no V4 Pro
No mesmo conjunto agregado de requisições:
Fora de pico
- Entrada: 1 × US$ 0,66 = US$ 0,66.
- Saída: 0,5 × US$ 1,98 = US$ 0,99.
- Total estimado: US$ 1,65.
Pico
- Entrada: 1 × US$ 1,32 = US$ 1,32.
- Saída: 0,5 × US$ 3,96 = US$ 1,98.
- Total estimado: US$ 3,30.
Exemplo 3: V4 Flash com parte da entrada em cache
Uma requisição contabiliza 700 mil tokens com cache hit, 200 mil sem cache e 100 mil de saída, totalizando 1 milhão de tokens na janela.
Fora de pico
- Cache hit: 0,7 × US$ 0,007 = US$ 0,0049.
- Cache miss: 0,2 × US$ 0,22 = US$ 0,044.
- Saída: 0,1 × US$ 0,66 = US$ 0,066.
- Total estimado: US$ 0,1149.
Pico
- Cache hit: 0,7 × US$ 0,014 = US$ 0,0098.
- Cache miss: 0,2 × US$ 0,44 = US$ 0,088.
- Saída: 0,1 × US$ 1,32 = US$ 0,132.
- Total estimado: US$ 0,2298.
O que significa cache hit no preço?
O Context Caching tenta reaproveitar unidades persistidas de um prefixo de entrada repetido. Quando há acerto, os tokens correspondentes recebem a tarifa de cache hit; o restante é cobrado como cache miss. O mecanismo não reutiliza uma resposta pronta e não garante que toda repetição produzirá um acerto.
Estruture instruções e documentos estáveis no início do prompt e conteúdo variável depois deles. Em seguida, acompanhe prompt_cache_hit_tokens e prompt_cache_miss_tokens em usage. Veja os detalhes e as limitações no guia de DeepSeek Context Caching.
V4 Flash ou V4 Pro: qual custa menos no seu caso?
| Critério | V4 Flash | V4 Pro |
|---|---|---|
| Estratégia inicial | Use como baseline | Teste como upgrade opcional |
| Melhor ajuste | Volume, velocidade, classificação, extração, resumo e chat | Raciocínio exigente, código complexo e agentes avançados |
| Como decidir | Compare qualidade, latência, tokens de saída, taxa de correção humana e custo por tarefa concluída | |
Um modelo com tarifa menor pode sair mais caro se exigir muitas novas tentativas; um modelo mais caro pode ser desperdício quando o Flash já atende ao critério de qualidade. Faça a comparação com exemplos reais e avalie custo por resultado aprovado, não apenas preço por token.
Limites de concorrência e impacto no orçamento
A documentação atual informa limites de 2.500 conexões concorrentes por conta para V4 Flash, 500 para V4 Pro e 2.500 para V4 Flash Vision Exp. A contagem ocorre no nível da conta, independentemente do número de chaves. Ao exceder o limite, a API retorna HTTP 429.
Isso não é uma franquia de tokens nem uma cobrança extra: é um controle de capacidade. Implemente fila, backoff com jitter, timeout e monitoramento. A documentação também permite solicitar expansão de capacidade, sujeita a avaliação. Para implementação, consulte o guia da DeepSeek API em português e o diagnóstico de erros HTTP 429 e outros códigos.
Saldo, cobrança, moeda e meios de pagamento
- Saldo: quando a conta possui saldo concedido e saldo recarregado, a documentação informa que o saldo concedido é usado primeiro.
- Moeda: a tabela oficial é publicada em dólar americano. Não fixamos conversões para real ou euro porque a cotação e as taxas variam.
- Pagamento: consulte no painel da sua conta quais métodos estão disponíveis para seu país e perfil. A lista pode mudar.
- Orçamento: considere também impostos, backend, observabilidade, armazenamento, revisão humana e serviços de terceiros.
Checklist para controlar custos
- Para texto, comece com V4 Flash e defina um conjunto fixo de avaliação. Use Vision Exp somente quando a tarefa exigir imagem; compare o Pro quando houver ganho mensurável de qualidade.
- Limite o tamanho da entrada e da saída conforme a tarefa.
- Evite reenviar histórico que não contribui para a resposta.
- Organize prefixos estáveis para aumentar a chance de cache hit.
- Registre tokens e custo por usuário, recurso e tarefa sem expor conteúdo sensível.
- Defina alertas, cotas internas e bloqueio quando o orçamento for atingido.
- Compare o V4 Pro apenas nos casos em que há espaço mensurável para ganho.
- Revise a página oficial de preços antes de cada previsão financeira importante.
Perguntas frequentes sobre preços
O chat oficial do DeepSeek é gratuito?
Na verificação de 5 de agosto de 2026, o chat e o aplicativo oficial eram apresentados com acesso gratuito, sujeitos às condições e aos limites do produto. Isso descreve a data verificada, não uma promessa permanente. Confira os canais pelo nosso guia do DeepSeek App.
A DeepSeek API tem plano gratuito?
Não trate a API como gratuita. Uma conta pode possuir saldo concedido, mas isso não transforma a tarifa em zero nem garante novos créditos. Verifique o saldo e as regras diretamente no painel oficial.
Quanto custa usar DeepSeek no PC?
No navegador, valem as condições do chat oficial. Ao executar pesos localmente, não há tarifa por token da API oficial, mas existem custos de hardware, energia, armazenamento e operação. Veja requisitos e limites no guia DeepSeek para PC com LM Studio.
Thinking Mode tem outra tarifa?
A tabela oficial diferencia modelo e tipo de token, não publica uma tarifa separada para ligar o Thinking Mode. Porém, a quantidade de tokens processados e gerados pode mudar; meça o campo usage em cargas reais.
Cache hit significa resposta grátis?
Não. Apenas os tokens de entrada que obtêm acerto recebem a tarifa reduzida. Tokens sem acerto e tokens de saída continuam cobrados.
Qual modelo devo usar para economizar?
Para tarefas de texto, comece com deepseek-v4-flash. O Vision Exp tem a mesma tarifa, mas deve ser escolhido quando a entrada inclui imagens. Compare o Pro apenas quando uma avaliação controlada mostrar ganho relevante. A escolha final deve considerar custo por tarefa aprovada.
Fontes oficiais consultadas
- Models & Pricing — tarifas, recursos e concorrência
- Token & Token Usage — contagem e campo usage
- Rate Limit & Isolation — limites e expansão de capacidade
- Site oficial da DeepSeek — acesso ao chat, app e API
Transparência editorial: conteúdo independente, sem parceria, patrocínio ou endosso da DeepSeek. Preços e catálogo reconferidos em 23 de agosto de 2026; testes históricos preservados nas datas indicadas.