DeepSeek vs ChatGPT: modelos, API, preços e privacidade

Resposta curta: no nosso teste controlado de API em português do Brasil, o GPT-5.6 Terra cumpriu estritamente 36 de 36 respostas, o DeepSeek V4 Pro cumpriu 33 de 36 e o V4 Flash, 30 de 36. Isso não torna um produto “melhor” em tudo: o Terra custou cerca de 10,2 vezes o Pro e 33,1 vezes o Flash nesta rodada, e o teste não avaliou os aplicativos ChatGPT ou DeepSeek Chat.

Verificação: 8 de agosto de 2026, no Brasil. Foram 108 chamadas POST válidas, mais dois preflights de modelos. As 108 respostas retornaram HTTP 200, sem nova tentativa e sem divergência entre o modelo solicitado e o devolvido.

Esta comparação independente separa três perguntas que costumam ser misturadas: qual modelo seguiu melhor instruções fechadas em PT-BR neste protocolo, quanto cada API cobrou na sessão e o que muda quando a escolha é entre os produtos ChatGPT e DeepSeek. Para um teste dedicado apenas ao idioma, veja também DeepSeek funciona em português? Teste do V4 no Brasil.

Resultado do teste ao vivo: DeepSeek vs GPT-5.6 Terra

V4 Flash

  • Aprovação estrita: 30/36 (83,3%)
  • Pontos: 66/72
  • Falhas críticas: 0
  • Latência mediana: 1.196,5 ms
  • Tokens: 6.349
  • Custo observado: US$ 0,0007753312

V4 Pro

  • Aprovação estrita: 33/36 (91,7%)
  • Pontos: 69/72
  • Falhas críticas: 0
  • Latência mediana: 1.550,5 ms
  • Tokens: 6.472
  • Custo observado: US$ 0,002504382

GPT-5.6 Terra

  • Aprovação estrita: 36/36 (100%)
  • Pontos: 72/72
  • Falhas críticas: 0
  • Latência mediana: 1.188,5 ms
  • Tokens: 5.798
  • Custo observado: US$ 0,025656
Resultado do teste ao vivo entre DeepSeek V4 Flash, V4 Pro e GPT-5.6 Terra em português brasileiro

O custo conjunto das 108 chamadas foi de US$ 0,0289357132, calculado com o uso devolvido pelas APIs e os preços oficiais conferidos no dia do teste. Esse valor não inclui impostos, câmbio, infraestrutura, outras ferramentas ou eventual diferença de faturamento. A diferença de apenas 8 ms entre as medianas do Terra e do Flash é pequena demais para sustentar uma conclusão geral de velocidade; latência muda com rede, fila, conta e backend.

O que cada modelo acertou — e onde perdeu pontos

Os três modelos passaram estritamente nas tarefas de adaptação lexical para o Brasil, data e moeda, atendimento limitado à fonte, resumo, JSON, tabela, cálculo comercial, recusa de dados ausentes, JavaScript e PostgreSQL. Nenhum recebeu nota zero nem inventou uma resposta crítica dentro dos critérios pré-registrados.

  • V4 Flash: perdeu aprovação estrita nas três repetições da conversão de horário por espaços finais e nas três repetições da tarefa com múltiplas restrições de linha. Foram falhas formais, pontuadas com 1/2.
  • V4 Pro: cumpriu a conversão de horário, mas perdeu aprovação estrita nas três repetições da tarefa com quatro linhas e contagens exatas de palavras. Também foram falhas formais, pontuadas com 1/2.
  • GPT-5.6 Terra: cumpriu todos os checks automáticos em todas as 36 respostas desta rodada.
Matriz por tarefa do benchmark PT-BR de DeepSeek V4 e GPT-5.6 Terra

“Aprovação estrita” significa cumprir todos os requisitos literais da tarefa; “1 ponto” indica uma falha apenas formal e não crítica; “0” seria uma falha crítica. O corpus é público no pacote de dados, portanto não funciona como conjunto secreto contra otimização. A qualidade natural do texto não recebeu nota humana: revisão humana de naturalidade = N/A.

O pacote inclui protocolo, prompts, ordem, resultados, resumo e checksums. SHA-256 do ZIP: 788d75473424df94475e75aa704061573baa1b979fe7ae2793a81d8febc1f502.

Como o teste foi feito

  1. Corpus congelado: 12 tarefas fechadas em português brasileiro, cobrindo localização, resumo baseado em fonte, formato, cálculo, calibração e código.
  2. Três repetições: cada tarefa foi enviada três vezes a cada modelo, sempre em uma conversa nova.
  3. Configuração equivalente: Chat Completions, temperature: 0, sem streaming. O Thinking foi desativado no DeepSeek; o Terra usou reasoning_effort: none. Não apareceram tokens de raciocínio.
  4. Ordem balanceada: uma rotação cíclica fez cada modelo ocupar a primeira, segunda e terceira posição 12 vezes. As chamadas foram seriais.
  5. Validação pré-definida: cada tarefa tinha checks literais. O código JavaScript foi executado em processo isolado com três casos de teste.
  6. Identidade verificada: o preflight exigiu os IDs exatos e os resultados registraram deepseek-v4-flash, deepseek-v4-pro e gpt-5.6-terra.

As APIs não são idênticas, por isso o objetivo foi igualar a intenção da configuração, não fingir que os backends são o mesmo sistema. A implementação segue as referências oficiais de Chat Completions da DeepSeek, modelos e preços da DeepSeek, GPT-5.6 Terra e orientação de modelos GPT-5.6.

Este é um teste de API, não dos aplicativos ChatGPT e DeepSeek

O benchmark enviou texto diretamente às APIs. Ele não mediu interface, pesquisa na web, upload de arquivos, voz, imagem, memória, projetos, agentes, personalização, limite de mensagens ou qualidade de resposta no plano gratuito. O ChatGPT é um produto que combina modelos e ferramentas; a página oficial de planos do ChatGPT deve ser consultada separadamente. O DeepSeek Chat também pode aplicar configurações, limites e versões que este teste não identifica.

Consequentemente, “GPT-5.6 Terra passou em 36/36” não significa “o ChatGPT é sempre melhor”, assim como o custo baixo do V4 Flash na API não descreve automaticamente a experiência gratuita do chat. Se a sua decisão é sobre o aplicativo móvel, consulte o nosso guia do aplicativo DeepSeek no Brasil.

Preços de API verificados em 8 de agosto de 2026

DeepSeek V4 Flash

Por 1 milhão de tokens: US$ 0,0028 de entrada em cache, US$ 0,14 sem cache e US$ 0,28 de saída.

DeepSeek V4 Pro

Por 1 milhão de tokens: US$ 0,003625 de entrada em cache, US$ 0,435 sem cache e US$ 0,87 de saída.

GPT-5.6 Terra

Por 1 milhão de tokens: US$ 0,20 de entrada em cache, US$ 2,00 sem cache e US$ 12,00 de saída. O preço de gravação de cache listado era US$ 2,50.

Como exemplo teórico, 10 milhões de tokens de entrada sem cache e 2 milhões de saída custariam aproximadamente US$ 1,96 no Flash, US$ 6,09 no Pro e US$ 44 no Terra. O cálculo não representa uma fatura real, não inclui impostos ou infraestrutura e não aplica multiplicadores de contexto longo. Preços e regras podem mudar; confira nossa metodologia completa de preços do DeepSeek e as páginas oficiais antes de contratar.

Qual escolher em cada cenário?

Para alto volume e orçamento restrito

O V4 Flash teve o menor custo do teste e ficou próximo do Terra na mediana de latência, embora tenha exigido mais tolerância ou pós-processamento em duas tarefas de formato estrito. É o primeiro candidato a testar quando custo por chamada domina e sua aplicação valida a saída.

Para instruções rígidas sem sair da API DeepSeek

O V4 Pro obteve três aprovações estritas a mais que o Flash, mas custou aproximadamente 3,2 vezes mais e teve maior latência mediana nesta sessão. Ele merece um piloto com o seu próprio corpus quando um erro de formato custa mais do que a diferença de tokens.

Para maximizar o cumprimento literal neste corpus

O GPT-5.6 Terra foi o único com 36/36 aprovações estritas. A contrapartida observada foi o maior custo. Antes de decidir, replique tarefas que representem o seu uso e compare o custo do erro, não apenas a tarifa por token.

Para uso casual no navegador ou celular

Compare os produtos, não esta planilha de API: disponibilidade no Brasil, ferramentas incluídas, limites do plano, política de dados e facilidade de uso podem pesar mais. Não presumimos que o modelo exposto por uma interface seja idêntico ao ID testado.

Contexto, ferramentas e integração

Na data da verificação, a documentação listava até 1 milhão de tokens de contexto para V4 Flash e Pro e 1.050.000 tokens para GPT-5.6 Terra. O nosso teste comparativo usou prompts curtos, portanto não confirma esses limites nem mede recuperação em documentos extensos. Consulte a página de modelos DeepSeek para a matriz atual e a documentação oficial de cada provedor.

Para integração, os três modelos deste teste aceitaram Chat Completions. A OpenAI recomenda a Responses API para fluxos mais ricos; a DeepSeek também documenta uma interface Responses com limites próprios. Veja o nosso guia da API DeepSeek, a verificação da Responses API e o guia de migração do SDK OpenAI para DeepSeek.

Privacidade: compare a rota e o produto que receberão os dados

A documentação de dados da API OpenAI afirma que dados enviados à API não são usados para treinar modelos, salvo adesão explícita, e descreve logs de monitoramento de abuso por até 30 dias como padrão, com controles adicionais sujeitos a elegibilidade. Isso é diferente das configurações e termos do produto ChatGPT.

A política de privacidade da DeepSeek deve ser lida junto dos termos da Open Platform. A própria política diferencia os serviços da DeepSeek de sistemas ou aplicativos de terceiros construídos sobre a plataforma; os termos exigem que desenvolvedores informem como tratam dados de usuários finais. Portanto, nunca atribua automaticamente a política da DeepSeek a um site independente que use sua API.

Não envie credenciais, dados de saúde, documentos jurídicos sigilosos ou informações pessoais sem uma análise adequada de contrato, retenção, região, suboperadores e controles da aplicação. Leia também a política de privacidade deste site.

Limites do comparativo

  • São 12 tarefas sintéticas e fechadas, não uma amostra de todo o português brasileiro nem de “inteligência geral”.
  • O corpus e os validadores são públicos; não existe conjunto privado de teste.
  • Não houve avaliação humana de naturalidade, criatividade, tom ou utilidade aberta.
  • Latência é observacional e não controla rede, fila, conta ou infraestrutura dos provedores.
  • Tokenização, cache e medição de uso diferem entre APIs; o custo usa os campos devolvidos por cada provedor.
  • O Thinking/raciocínio foi desativado. Resultados não descrevem modos pensantes.
  • Não foram testados arquivos, visão, voz, web, ferramentas, memória, agentes ou interfaces dos produtos.
  • A rodada vale para os IDs, fingerprints disponíveis, preços e data registrados; backends futuros podem mudar.

Perguntas frequentes

DeepSeek é melhor que ChatGPT?

Não há resposta universal. O GPT-5.6 Terra cumpriu 36/36 saídas estritas neste protocolo, enquanto DeepSeek V4 Pro e Flash custaram muito menos. Aplicativos, ferramentas, privacidade, contexto e seu próprio tipo de tarefa podem mudar a decisão.

O teste compara as versões gratuitas?

Não. Ele compara IDs de modelos pagos por API, com configuração controlada. Nenhuma conclusão foi tirada sobre os planos gratuitos do ChatGPT ou do DeepSeek Chat.

Qual API foi mais barata?

O V4 Flash foi o mais barato nesta sessão: US$ 0,0007753312 para 36 chamadas. O Pro custou cerca de 3,2 vezes isso e o Terra, 33,1 vezes. Uma carga real pode ter proporções diferentes por causa de tokens de saída, cache e tamanho do prompt.

Os três entendem português brasileiro?

Os três cumpriram as tarefas centrais de PT-BR, incluindo vocabulário brasileiro, moeda, data, resumo e atendimento baseado em fonte. O teste é positivo para esse corpus, mas não cobre todos os sotaques, registros ou áreas profissionais.

Posso enviar dados sensíveis?

Não por padrão. Primeiro verifique o produto exato, os termos, retenção, contrato e controles do seu integrador. Uma API e um aplicativo de terceiro podem ter fluxos de dados diferentes.


Última verificação: 8 de agosto de 2026. Esta página é independente e não representa DeepSeek nem OpenAI. Atualizaremos o mesmo URL quando houver mudança material de modelos, preços ou comportamento da API.