DeepSeek funciona em português? Teste do V4 no Brasil

Teste reproduzível do DeepSeek V4 Flash e Pro em português brasileiro: 36 chamadas, resultados, custo, latência, dados brutos e limites.

Resposta curta: sim. Na rodada mais recente, o DeepSeek V4 concluiu 72 chamadas em português brasileiro sem falha crítica. O Pro obteve 32/36 aprovações estritas e o Flash 30/36; a diferença é pequena e não prova um vencedor universal.

Transparência: este é um teste editorial independente do DeepSeek Português, sem afiliação com a DeepSeek. As chamadas foram feitas na API oficial com uma chave temporária, revogada após a verificação; nenhum segredo, saldo ou dado da conta aparece nas evidências.

Esta página reúne 108 chamadas em duas rodadas. A coleta mais recente ocorreu em 8 de agosto de 2026, entre 23:41:28 e 23:42:53 UTC. O foco foi o português brasileiro para quem usa o serviço no Brasil — não a localização física do servidor. Para uma visão ampla de chat, aplicativo, modelos e API, consulte o nosso guia de DeepSeek em português.

Resultado mais recente: rodada 2 (8 de agosto de 2026)

A segunda rodada fez 72 chamadas autenticadas à API oficial: 12 tarefas, dois modelos e três repetições por combinação. Todas as chamadas retornaram HTTP 200 entre 23:41:28 e 23:42:53 UTC. O Thinking ficou desativado e a chave temporária foi revogada após a coleta e a verificação.

  • V4 Flash: 30/36 aprovações estritas (83,3%), 66/72 pontos, latência mediana de 1.003 ms, 6.351 tokens e custo observado de US$ 0,0007758912.
  • V4 Pro: 32/36 aprovações estritas (88,9%), 68/72 pontos, latência mediana de 1.287 ms, 6.447 tokens e custo observado de US$ 0,002482632.
  • Confiabilidade básica: 36/36 respostas HTTP 200 em cada modelo e nenhuma falha crítica.
  • Leitura correta: o Pro obteve duas aprovações estritas a mais, mas custou cerca de 3,2 vezes o Flash e teve latência mediana 28,4% maior nesta janela. A amostra não estabelece um vencedor universal.
Comparação do DeepSeek V4 Flash e V4 Pro em português brasileiro, com aprovação, latência, tokens e custo
Rodada 2: 72 chamadas autenticadas, 12 tarefas e três repetições por modelo, em 8 de agosto de 2026.

O que os números mostram

Os dois modelos concluíram com sucesso as tarefas de data e moeda do Brasil, atendimento baseado somente em uma fonte fornecida, resumo fechado, JSON tipado, tabela Markdown, cálculo comercial, recusa de dados ausentes, JavaScript testável e SQL com regras fechadas. Os desvios restantes foram de forma — número de frases, contagem de palavras ou espaços finais — e não de segurança, fonte ou cálculo.

  • R2-01 — adaptação pt-BR: o Flash cumpriu as três regras formais; o Pro produziu texto localizado, mas em uma frase quando o teste exigia duas.
  • R2-08 — horário UTC−3: os horários e a ordem do Flash estavam corretos, porém havia espaços finais proibidos; o Pro passou nas três repetições.
  • R2-12 — formato estrito: o Flash falhou nas três repetições e o Pro passou em duas. Os erros foram de contagem ou espaços finais, sem falha crítica.
Matriz de 12 tarefas do teste DeepSeek V4 em português brasileiro, com três repetições por modelo
Aprovações estritas por tarefa na rodada 2; os desvios restantes foram de formato e não houve falhas críticas.

Metodologia da rodada 2

  1. Consultamos primeiro a lista oficial de modelos e confirmamos deepseek-v4-flash e deepseek-v4-pro.
  2. Usamos Chat Completions, temperature: 0, stream: false e Thinking desativado.
  3. Executamos 12 prompts sintéticos em português brasileiro, três vezes em cada modelo, sem busca, ferramentas ou dados pessoais.
  4. Guardamos horário, status HTTP, ID, modelo retornado, fingerprint, latência, tokens, custo, resposta bruta e SHA-256.
  5. Aplicamos regras determinísticas publicadas antes da leitura editorial e depois revisamos manualmente todos os resultados marcados como falha.
  6. Recalculamos custo com os preços oficiais verificados em 8 de agosto de 2026: tokens de entrada com cache, entrada sem cache e saída.

O protocolo mede obediência estrita dentro deste corpus; ele não transforma preferência editorial em “acerto”. Para contexto sobre consumo, veja o estudo Quantos tokens o português brasileiro usa?. Para diferenças de produto e uso, consulte DeepSeek V4 Flash e Pro.

Revisão dos validadores: duas correções documentadas

A primeira pontuação automática marcou duas respostas corretas de forma errada. Em R2-03, a frase negativa “não há garantia” foi interpretada como promessa; em R2-08, dois espaços finais transformaram horários corretos em falha crítica. Corrigimos somente as regras de validação e recalculamos as notas sobre as mesmas respostas imutáveis. Conteúdo, hashes, timestamps, tokens, latência e custo não foram alterados. A revisão está incluída na documentação para que o leitor consiga auditar a mudança.

Dados brutos, protocolo e arquivos para reprodução

Baixar o CSV da rodada 2 ou baixar o pacote completo. O ZIP reúne protocolo, configuração, prompts, respostas em CSV e JSONL, resumo por tarefa, revisão dos validadores, imagens e checksums SHA-256. Nenhum arquivo contém chave de API, e-mail, saldo ou cabeçalho de autorização.

Para verificar a integridade, extraia o pacote e compare cada arquivo com checksums-sha256.txt. Os 13 hashes foram recalculados localmente antes do envio. Uma reprodução futura pode retornar respostas diferentes se a DeepSeek alterar o backend; por isso, registre data, fingerprint e preços usados.

Rodada 1 e rodada 2 não formam uma série causal

  • Rodada 1, 29 de julho: 36 chamadas, seis tarefas; Flash e Pro tiveram 15/18 aprovações estritas.
  • Rodada 2, 8 de agosto: 72 chamadas, 12 tarefas; Flash teve 30/36 e Pro 32/36.
  • O corpus foi ampliado e o prompt de sistema mudou. Portanto, a diferença agregada não prova melhora ou piora do modelo entre as datas.
  • R2-12 reutilizou o prompt do usuário do antigo T03, mas com outro prompt de sistema; serve para observar o novo protocolo, não para atribuir causalidade.

Rodada 1: resultado histórico (29 de julho de 2026)

  • V4 Flash: 15/18 aprovações estritas, 30/36 pontos, mediana de 958 ms e custo total de US$ 0,000439.
  • V4 Pro: 15/18 aprovações estritas, 33/36 pontos, mediana de 1.175 ms e custo total de US$ 0,001398.
  • Os dois modelos converteram PT-PT para PT-BR, distinguiram as duas variantes, resumiram apenas a fonte, devolveram JSON válido e recusaram uma informação não sustentada em todas as três repetições.
  • Os dois falharam no T03, que exigia contagens exatas de palavras e linhas. O erro foi mantido e documentado.
  • O teste cobre somente a API com Thinking desativado. Não cobre o app, o chat web, imagens, voz, busca ou conhecimento atualizado.
Comparação dos resultados do DeepSeek V4 Flash e Pro em português brasileiro
Resultado de 36 chamadas autenticadas: seis testes, dois modelos e três repetições por combinação.

Rodada 1: o que foi testado — e o que ficou de fora

A pergunta “DeepSeek funciona em português?” mistura capacidades diferentes. Por isso, a bateria isolou seis tarefas verificáveis em pt-BR: adaptação de PT-PT, classificação de variantes, obediência a formato exato, resumo baseado somente em uma fonte fornecida, JSON estruturado e recusa de dado ausente. Os textos-fonte foram criados para o teste; assim, a correção não depende de memória ou de pesquisa na internet.

TesteHabilidade observadaCritério principal
T01PT-PT → PT-BRVocabulário brasileiro, sentido preservado e duas frases
T02PT-BR × PT-PTQuatro classificações literais, sem explicação
T03Instruções exatasQuatro linhas e contagem precisa de palavras
T04Resumo com fonteSomente fatos fornecidos e limites de 18 palavras
T05JSONEstrutura, tipos e valores exatos, sem chaves extras
T06Não inventarFrase literal recusando fabricante e precisão ausentes
Cada teste foi repetido três vezes em cada modelo.

Não avaliamos criatividade, estilo literário, código, documentos longos, pesquisa, ferramentas, multimodalidade ou fatos recentes. Também não comparamos o resultado com outros provedores. As páginas de DeepSeek V4 e de modelos do DeepSeek tratam das especificações e do histórico; esta página é dona apenas da intenção de teste em português brasileiro.

Rodada 1: metodologia reproduzível

  1. Usamos a API oficial de Chat Completions e confirmamos antes da coleta que a lista de modelos retornava deepseek-v4-flash e deepseek-v4-pro.
  2. Executamos seis prompts em cada modelo, três vezes por combinação: 36 respostas HTTP 200.
  3. Cada execução começou uma conversa nova, sem histórico, ferramentas ou busca.
  4. Fixamos temperature: 0, stream: false e thinking: {"type":"disabled"}. Não enviamos seed, pois esse parâmetro não estava documentado no endpoint consultado.
  5. Alternamos a ordem de Flash e Pro entre as repetições para reduzir um possível efeito de ordem.
  6. Normalizamos Unicode para NFC e quebras de linha para LF. Removemos apenas espaço externo do conteúdo completo; espaços no fim de linhas internas continuaram contando.
  7. Guardamos resposta bruta, horário UTC, modelo solicitado e retornado, fingerprint, ID da resposta, latência, finish_reason, uso de tokens, verificações e SHA-256. A chave da API não foi registrada.

O tempo foi medido do lado do cliente e inclui rede; portanto, não é uma medição exclusiva do processamento do modelo. O custo usa os campos reais de usage e os preços oficiais por cache hit, cache miss e saída verificados no dia do teste. Veja também nosso guia de API do DeepSeek e a página de preços com metodologia.

Rodada 1: resultados por modelo

MedidaV4 FlashV4 Pro
Aprovação estrita15/18 (83,3%)15/18 (83,3%)
Pontos30/3633/36
Mediana de latência957,5 ms1.174,5 ms
Tokens totais4.0094.058
Prompt / saída3.378 / 6313.378 / 680
Cache hit no prompt1.5361.536
Custo das 18 chamadasUS$ 0,0004388608US$ 0,001398438
Fingerprint observadofp_8b330d02d0_prod0820_fp8_kvcache_20260402fp_9954b31ca7_prod0820_fp8_kvcache_20260402

Os 3 pontos extras do Pro vieram somente do T03: o conteúdo e a contagem de palavras ficaram corretos, mas três linhas terminaram com dois espaços. Pela regra publicada, isso não é aprovação estrita. Nesta amostra, portanto, não há base para dizer que o Pro “fala português melhor”; ele apenas teve um erro formal menos grave nesse teste.

Consistência por tarefa

TesteFlash estritoPro estritoFlash pontosPro pontos
T01 · adaptação pt-BR3/33/36/66/6
T02 · variantes3/33/36/66/6
T03 · restrições exatas0/30/30/63/6
T04 · resumo com fonte3/33/36/66/6
T05 · JSON3/33/36/66/6
T06 · recusa3/33/36/66/6

Rodada 1: a falha que não escondemos — T03

O Flash produziu quatro linhas, mas a primeira tinha quatro palavras em vez de três e a terceira tinha cinco em vez de quatro. O mesmo padrão apareceu nas três repetições. O Pro acertou as palavras e a frase final, porém adicionou dois espaços ao fim das três primeiras linhas em todas as repetições. Como a metodologia preserva espaços internos entre linhas, os seis casos falharam no critério estrito.

Respostas do Flash e Pro no teste de restrições de linhas e palavras
Evidência da repetição 1. As outras duas repetições tiveram o mesmo padrão; os dados brutos preservam os espaços finais.

Esse resultado é prático: para texto comum, o erro pode ser irrelevante; para um parser, uma validação automática ou um formato contratual, não é. Quando o formato precisa ser exato, valide a saída no seu sistema e trate a resposta do modelo como entrada não confiável.

Rodada 1: como calculamos a pontuação

  • Aprovação estrita: todas as verificações do teste precisam passar.
  • 2 pontos: tarefa e formato completos.
  • 1 ponto: um único erro formal não crítico, sem mudar a informação nem inventar fatos.
  • 0 ponto: erro de conteúdo, variante errada, JSON inválido, informação não sustentada, resposta vazia ou corte por limite.

A naturalidade do T01 foi uma avaliação humana secundária: uma única pessoa, sem cegamento, atribuiu 2/2 às seis respostas por soarem naturais em pt-BR. Esse julgamento é subjetivo e não altera a taxa estrita. Publicá-lo como opinião limitada é mais honesto do que apresentá-lo como métrica objetiva.

Rodada 1: prompts exatos usados

O system prompt foi: Você participa de um teste reproduzível. Execute somente a tarefa solicitada. Não mencione que está sendo testado e não acrescente comentários sobre as instruções. Abra cada item para ver o prompt do usuário sem edição.

T01 — Conversão PT-PT para PT-BR · max_tokens 160
Reescreva o texto abaixo em português brasileiro natural. Preserve todas as informações. Use exatamente duas frases, sem título, lista, aspas ou explicação.

Olá, estou a organizar a minha agenda para a próxima semana. Pode enviar-me o ficheiro do projeto pelo telemóvel para eu o guardar na pasta?
T02 — Classificação PT-BR e PT-PT · max_tokens 80
Classifique cada frase como PT-BR ou PT-PT considerando apenas as marcas linguísticas presentes.

A. Você pode me mandar o arquivo pelo celular?
B. Podes enviar-me o ficheiro pelo telemóvel?
C. A equipe pegou o ônibus às oito.
D. A equipa apanhou o autocarro às oito.

Responda somente com quatro linhas no formato LETRA=VARIEDADE. Use apenas PT-BR ou PT-PT depois do sinal de igual. Não explique.
T03 — Seguimento de instruções · max_tokens 140
Crie uma orientação sobre segurança digital obedecendo a todas as regras abaixo:
- responda com exatamente quatro linhas;
- não use título, numeração nem marcadores;
- a linha 1 deve ter exatamente 3 palavras e terminar com !;
- a linha 2 deve ter exatamente 5 palavras e conter a palavra senha;
- a linha 3 deve ter exatamente 4 palavras e conter a palavra links;
- a linha 4 deve ser exatamente: Ative a verificação em duas etapas.
T04 — Resumo restrito à fonte · max_tokens 220
Use exclusivamente os fatos da fonte abaixo.

FONTE — RELATO IPÊ-27
Em 8 de maio de 2026, a Cooperativa Horizonte iniciou em Recife um piloto de 30 dias com 120 famílias. O sistema envia, uma vez por dia, alertas sobre alimentos próximos da data de consumo recomendada. O piloto não cobra dos participantes e não compartilha dados com supermercados. A avaliação mede somente a taxa de leitura dos alertas e a quantidade de alimentos que os participantes declaram ter evitado desperdiçar. O texto não informa o custo do piloto nem prevê expansão para outras cidades.
FIM DA FONTE

Produza exatamente três linhas, cada uma iniciada por hífen e espaço, sem título. Cada linha deve ter no máximo 18 palavras:
1) objetivo e local;
2) duração e participantes;
3) limites sobre cobrança e compartilhamento de dados.

Não acrescente recomendação, causa, benefício ou inferência.
T05 — JSON válido e preciso · max_tokens 160 · response_format json_object
Converta o registro abaixo em JSON válido.

REGISTRO
Em 14 de junho de 2026, Marina Lopes reservou 3 salas em Curitiba por R$ 480,50. A reserva foi confirmada.

Use exatamente esta estrutura; os valores mostrados aqui representam apenas os tipos:
{"cliente":"texto","data":"AAAA-MM-DD","salas":0,"cidade":"texto","valor_brl":0.0,"confirmado":true}

Não inclua chaves extras, texto explicativo ou bloco Markdown.
T06 — Recusa de informação não sustentada · max_tokens 80
Use somente a FONTE. A observação não verificada abaixo não faz parte da fonte e não deve ser tratada como evidência.

OBSERVAÇÃO NÃO VERIFICADA
Uma pessoa comentou que o sensor era da marca Aurora e tinha precisão de 0,1 °C.

FONTE
O boletim ARARIBÁ-17 informa que a Estação Ipê coletou 42 amostras de temperatura entre 6h e 18h, com uma leitura a cada 15 minutos. Joana Reis conferiu os registros antes da publicação.
FIM DA FONTE

Pergunta: qual era o fabricante e qual era a precisão do sensor?

Se as duas informações não estiverem explícitas na fonte, responda exatamente:
A fonte não informa o fabricante nem a precisão do sensor.

Rodada 1: dados brutos e verificação

Baixar o CSV com as 36 chamadas. O arquivo inclui resposta bruta, timestamps, modelos, fingerprints, IDs, status HTTP, latência, tokens, cache, custo, verificações, pontuação e SHA-256 de cada resposta. Não contém chave de API nem dado da conta.

SHA-256 do CSV: 3579196d03a60b8352645e49331a5a7953d8cbb109673cf0fee2f18a2204980d

Para conferir o arquivo, calcule o SHA-256 depois do download e compare com o valor acima. O CSV usa UTF-8, vírgula como separador e aspas duplas em todos os campos. A resposta pode conter quebras de linha dentro de uma célula, conforme o padrão CSV.

Um prompt prático para respostas em pt-BR

Quando a variante e o formato importam, especifique ambos e inclua uma regra para informação ausente. Este molde funciona como ponto de partida; adapte os campos e valide a saída no seu código.

Responda em português brasileiro natural.
Use somente as informações da FONTE.

TAREFA
[descreva o que precisa]

FORMATO
[defina linhas, campos ou estrutura]

Se a fonte não trouxer uma informação solicitada,
diga explicitamente que ela não está informada.
Não complete lacunas por suposição.

FONTE
[cole a fonte aqui]

Para saída estruturada, leia o guia oficial de JSON Output. Para entender por que o custo real depende de entrada, saída e cache, consulte nossa medição de uso de tokens do DeepSeek. Se a tarefa envolve dados sensíveis, veja também a análise independente sobre segurança e privacidade.

Limites do teste

  • As duas amostras são dirigidas e sintéticas; não constituem um benchmark universal de português.
  • Os totais das duas rodadas não são diretamente comparáveis porque o corpus e o prompt de sistema mudaram.
  • Três repetições por combinação não permitem inferência estatística.
  • O teste usa a API. Não mede o comportamento do app oficial nem do chat web.
  • Thinking foi desativado para isolar a tarefa linguística e reduzir custo. Os resultados não medem o Thinking Mode.
  • Não houve teste de busca, ferramentas, código, imagens, áudio, documentos longos ou fatos atuais.
  • temperature: 0 reduz variação, mas não garante determinismo; não havia seed documentado.
  • Latência varia com rede, região, carga e backend. O fingerprint mostra somente o backend observado naquela janela.
  • Preços, modelos e comportamento podem mudar. Confira a documentação oficial antes de decidir produção ou orçamento.

Perguntas frequentes

O DeepSeek entende português brasileiro?

Nesta amostra, sim. Na rodada 2, os dois modelos concluíram 36/36 chamadas sem falha crítica e seguiram corretamente fonte fechada, cálculos, JSON, código e regras do Brasil. Alguns resultados perderam a aprovação estrita apenas por frase, contagem ou espaço final. Isso não garante desempenho igual em qualquer tema ou extensão.

Flash ou Pro foi melhor em português?

Na rodada 2, o Pro teve 32/36 aprovações estritas e 68/72 pontos; o Flash, 30/36 e 66/72. Em troca, o Pro custou cerca de 3,2 vezes mais e teve latência mediana 28,4% maior nesta janela. Dois acertos formais de diferença não sustentam um vencedor geral.

Este teste vale para o aplicativo DeepSeek?

Não. Foi um teste autenticado da API com parâmetros explícitos. O aplicativo oficial do DeepSeek pode usar configurações, prompts de sistema e recursos diferentes.

Consigo reproduzir os resultados?

Sim. O pacote da rodada 2 publica prompts, parâmetros, regras, fingerprints, respostas brutas, revisão dos validadores e checksums. Ainda assim, uma reprodução futura pode diferir se o backend mudar; registre a data e o novo fingerprint em vez de substituir silenciosamente o resultado anterior.

Fontes oficiais

Última verificação da metodologia, dos arquivos e das fontes citadas: 8 de agosto de 2026.