Resposta curta: sim. Na rodada mais recente, o DeepSeek V4 concluiu 72 chamadas em português brasileiro sem falha crítica. O Pro obteve 32/36 aprovações estritas e o Flash 30/36; a diferença é pequena e não prova um vencedor universal.
Transparência: este é um teste editorial independente do DeepSeek Português, sem afiliação com a DeepSeek. As chamadas foram feitas na API oficial com uma chave temporária, revogada após a verificação; nenhum segredo, saldo ou dado da conta aparece nas evidências.
Esta página reúne 108 chamadas em duas rodadas. A coleta mais recente ocorreu em 8 de agosto de 2026, entre 23:41:28 e 23:42:53 UTC. O foco foi o português brasileiro para quem usa o serviço no Brasil — não a localização física do servidor. Para uma visão ampla de chat, aplicativo, modelos e API, consulte o nosso guia de DeepSeek em português.
Resultado mais recente: rodada 2 (8 de agosto de 2026)
A segunda rodada fez 72 chamadas autenticadas à API oficial: 12 tarefas, dois modelos e três repetições por combinação. Todas as chamadas retornaram HTTP 200 entre 23:41:28 e 23:42:53 UTC. O Thinking ficou desativado e a chave temporária foi revogada após a coleta e a verificação.
- V4 Flash: 30/36 aprovações estritas (83,3%), 66/72 pontos, latência mediana de 1.003 ms, 6.351 tokens e custo observado de US$ 0,0007758912.
- V4 Pro: 32/36 aprovações estritas (88,9%), 68/72 pontos, latência mediana de 1.287 ms, 6.447 tokens e custo observado de US$ 0,002482632.
- Confiabilidade básica: 36/36 respostas HTTP 200 em cada modelo e nenhuma falha crítica.
- Leitura correta: o Pro obteve duas aprovações estritas a mais, mas custou cerca de 3,2 vezes o Flash e teve latência mediana 28,4% maior nesta janela. A amostra não estabelece um vencedor universal.

O que os números mostram
Os dois modelos concluíram com sucesso as tarefas de data e moeda do Brasil, atendimento baseado somente em uma fonte fornecida, resumo fechado, JSON tipado, tabela Markdown, cálculo comercial, recusa de dados ausentes, JavaScript testável e SQL com regras fechadas. Os desvios restantes foram de forma — número de frases, contagem de palavras ou espaços finais — e não de segurança, fonte ou cálculo.
- R2-01 — adaptação pt-BR: o Flash cumpriu as três regras formais; o Pro produziu texto localizado, mas em uma frase quando o teste exigia duas.
- R2-08 — horário UTC−3: os horários e a ordem do Flash estavam corretos, porém havia espaços finais proibidos; o Pro passou nas três repetições.
- R2-12 — formato estrito: o Flash falhou nas três repetições e o Pro passou em duas. Os erros foram de contagem ou espaços finais, sem falha crítica.

Metodologia da rodada 2
- Consultamos primeiro a lista oficial de modelos e confirmamos
deepseek-v4-flashedeepseek-v4-pro. - Usamos Chat Completions,
temperature: 0,stream: falsee Thinking desativado. - Executamos 12 prompts sintéticos em português brasileiro, três vezes em cada modelo, sem busca, ferramentas ou dados pessoais.
- Guardamos horário, status HTTP, ID, modelo retornado, fingerprint, latência, tokens, custo, resposta bruta e SHA-256.
- Aplicamos regras determinísticas publicadas antes da leitura editorial e depois revisamos manualmente todos os resultados marcados como falha.
- Recalculamos custo com os preços oficiais verificados em 8 de agosto de 2026: tokens de entrada com cache, entrada sem cache e saída.
O protocolo mede obediência estrita dentro deste corpus; ele não transforma preferência editorial em “acerto”. Para contexto sobre consumo, veja o estudo Quantos tokens o português brasileiro usa?. Para diferenças de produto e uso, consulte DeepSeek V4 Flash e Pro.
Revisão dos validadores: duas correções documentadas
A primeira pontuação automática marcou duas respostas corretas de forma errada. Em R2-03, a frase negativa “não há garantia” foi interpretada como promessa; em R2-08, dois espaços finais transformaram horários corretos em falha crítica. Corrigimos somente as regras de validação e recalculamos as notas sobre as mesmas respostas imutáveis. Conteúdo, hashes, timestamps, tokens, latência e custo não foram alterados. A revisão está incluída na documentação para que o leitor consiga auditar a mudança.
Dados brutos, protocolo e arquivos para reprodução
Baixar o CSV da rodada 2 ou baixar o pacote completo. O ZIP reúne protocolo, configuração, prompts, respostas em CSV e JSONL, resumo por tarefa, revisão dos validadores, imagens e checksums SHA-256. Nenhum arquivo contém chave de API, e-mail, saldo ou cabeçalho de autorização.
Para verificar a integridade, extraia o pacote e compare cada arquivo com checksums-sha256.txt. Os 13 hashes foram recalculados localmente antes do envio. Uma reprodução futura pode retornar respostas diferentes se a DeepSeek alterar o backend; por isso, registre data, fingerprint e preços usados.
Rodada 1 e rodada 2 não formam uma série causal
- Rodada 1, 29 de julho: 36 chamadas, seis tarefas; Flash e Pro tiveram 15/18 aprovações estritas.
- Rodada 2, 8 de agosto: 72 chamadas, 12 tarefas; Flash teve 30/36 e Pro 32/36.
- O corpus foi ampliado e o prompt de sistema mudou. Portanto, a diferença agregada não prova melhora ou piora do modelo entre as datas.
- R2-12 reutilizou o prompt do usuário do antigo T03, mas com outro prompt de sistema; serve para observar o novo protocolo, não para atribuir causalidade.
Rodada 1: resultado histórico (29 de julho de 2026)
- V4 Flash: 15/18 aprovações estritas, 30/36 pontos, mediana de 958 ms e custo total de US$ 0,000439.
- V4 Pro: 15/18 aprovações estritas, 33/36 pontos, mediana de 1.175 ms e custo total de US$ 0,001398.
- Os dois modelos converteram PT-PT para PT-BR, distinguiram as duas variantes, resumiram apenas a fonte, devolveram JSON válido e recusaram uma informação não sustentada em todas as três repetições.
- Os dois falharam no T03, que exigia contagens exatas de palavras e linhas. O erro foi mantido e documentado.
- O teste cobre somente a API com Thinking desativado. Não cobre o app, o chat web, imagens, voz, busca ou conhecimento atualizado.

Rodada 1: o que foi testado — e o que ficou de fora
A pergunta “DeepSeek funciona em português?” mistura capacidades diferentes. Por isso, a bateria isolou seis tarefas verificáveis em pt-BR: adaptação de PT-PT, classificação de variantes, obediência a formato exato, resumo baseado somente em uma fonte fornecida, JSON estruturado e recusa de dado ausente. Os textos-fonte foram criados para o teste; assim, a correção não depende de memória ou de pesquisa na internet.
| Teste | Habilidade observada | Critério principal |
|---|---|---|
| T01 | PT-PT → PT-BR | Vocabulário brasileiro, sentido preservado e duas frases |
| T02 | PT-BR × PT-PT | Quatro classificações literais, sem explicação |
| T03 | Instruções exatas | Quatro linhas e contagem precisa de palavras |
| T04 | Resumo com fonte | Somente fatos fornecidos e limites de 18 palavras |
| T05 | JSON | Estrutura, tipos e valores exatos, sem chaves extras |
| T06 | Não inventar | Frase literal recusando fabricante e precisão ausentes |
Não avaliamos criatividade, estilo literário, código, documentos longos, pesquisa, ferramentas, multimodalidade ou fatos recentes. Também não comparamos o resultado com outros provedores. As páginas de DeepSeek V4 e de modelos do DeepSeek tratam das especificações e do histórico; esta página é dona apenas da intenção de teste em português brasileiro.
Rodada 1: metodologia reproduzível
- Usamos a API oficial de Chat Completions e confirmamos antes da coleta que a lista de modelos retornava
deepseek-v4-flashedeepseek-v4-pro. - Executamos seis prompts em cada modelo, três vezes por combinação: 36 respostas HTTP 200.
- Cada execução começou uma conversa nova, sem histórico, ferramentas ou busca.
- Fixamos
temperature: 0,stream: falseethinking: {"type":"disabled"}. Não enviamosseed, pois esse parâmetro não estava documentado no endpoint consultado. - Alternamos a ordem de Flash e Pro entre as repetições para reduzir um possível efeito de ordem.
- Normalizamos Unicode para NFC e quebras de linha para LF. Removemos apenas espaço externo do conteúdo completo; espaços no fim de linhas internas continuaram contando.
- Guardamos resposta bruta, horário UTC, modelo solicitado e retornado, fingerprint, ID da resposta, latência,
finish_reason, uso de tokens, verificações e SHA-256. A chave da API não foi registrada.
O tempo foi medido do lado do cliente e inclui rede; portanto, não é uma medição exclusiva do processamento do modelo. O custo usa os campos reais de usage e os preços oficiais por cache hit, cache miss e saída verificados no dia do teste. Veja também nosso guia de API do DeepSeek e a página de preços com metodologia.
Rodada 1: resultados por modelo
| Medida | V4 Flash | V4 Pro |
|---|---|---|
| Aprovação estrita | 15/18 (83,3%) | 15/18 (83,3%) |
| Pontos | 30/36 | 33/36 |
| Mediana de latência | 957,5 ms | 1.174,5 ms |
| Tokens totais | 4.009 | 4.058 |
| Prompt / saída | 3.378 / 631 | 3.378 / 680 |
| Cache hit no prompt | 1.536 | 1.536 |
| Custo das 18 chamadas | US$ 0,0004388608 | US$ 0,001398438 |
| Fingerprint observado | fp_8b330d02d0_prod0820_fp8_kvcache_20260402 | fp_9954b31ca7_prod0820_fp8_kvcache_20260402 |
Os 3 pontos extras do Pro vieram somente do T03: o conteúdo e a contagem de palavras ficaram corretos, mas três linhas terminaram com dois espaços. Pela regra publicada, isso não é aprovação estrita. Nesta amostra, portanto, não há base para dizer que o Pro “fala português melhor”; ele apenas teve um erro formal menos grave nesse teste.
Consistência por tarefa
| Teste | Flash estrito | Pro estrito | Flash pontos | Pro pontos |
|---|---|---|---|---|
| T01 · adaptação pt-BR | 3/3 | 3/3 | 6/6 | 6/6 |
| T02 · variantes | 3/3 | 3/3 | 6/6 | 6/6 |
| T03 · restrições exatas | 0/3 | 0/3 | 0/6 | 3/6 |
| T04 · resumo com fonte | 3/3 | 3/3 | 6/6 | 6/6 |
| T05 · JSON | 3/3 | 3/3 | 6/6 | 6/6 |
| T06 · recusa | 3/3 | 3/3 | 6/6 | 6/6 |
Rodada 1: a falha que não escondemos — T03
O Flash produziu quatro linhas, mas a primeira tinha quatro palavras em vez de três e a terceira tinha cinco em vez de quatro. O mesmo padrão apareceu nas três repetições. O Pro acertou as palavras e a frase final, porém adicionou dois espaços ao fim das três primeiras linhas em todas as repetições. Como a metodologia preserva espaços internos entre linhas, os seis casos falharam no critério estrito.

Esse resultado é prático: para texto comum, o erro pode ser irrelevante; para um parser, uma validação automática ou um formato contratual, não é. Quando o formato precisa ser exato, valide a saída no seu sistema e trate a resposta do modelo como entrada não confiável.
Rodada 1: como calculamos a pontuação
- Aprovação estrita: todas as verificações do teste precisam passar.
- 2 pontos: tarefa e formato completos.
- 1 ponto: um único erro formal não crítico, sem mudar a informação nem inventar fatos.
- 0 ponto: erro de conteúdo, variante errada, JSON inválido, informação não sustentada, resposta vazia ou corte por limite.
A naturalidade do T01 foi uma avaliação humana secundária: uma única pessoa, sem cegamento, atribuiu 2/2 às seis respostas por soarem naturais em pt-BR. Esse julgamento é subjetivo e não altera a taxa estrita. Publicá-lo como opinião limitada é mais honesto do que apresentá-lo como métrica objetiva.
Rodada 1: prompts exatos usados
O system prompt foi: Você participa de um teste reproduzível. Execute somente a tarefa solicitada. Não mencione que está sendo testado e não acrescente comentários sobre as instruções. Abra cada item para ver o prompt do usuário sem edição.
T01 — Conversão PT-PT para PT-BR · max_tokens 160
Reescreva o texto abaixo em português brasileiro natural. Preserve todas as informações. Use exatamente duas frases, sem título, lista, aspas ou explicação.
Olá, estou a organizar a minha agenda para a próxima semana. Pode enviar-me o ficheiro do projeto pelo telemóvel para eu o guardar na pasta?
T02 — Classificação PT-BR e PT-PT · max_tokens 80
Classifique cada frase como PT-BR ou PT-PT considerando apenas as marcas linguísticas presentes.
A. Você pode me mandar o arquivo pelo celular?
B. Podes enviar-me o ficheiro pelo telemóvel?
C. A equipe pegou o ônibus às oito.
D. A equipa apanhou o autocarro às oito.
Responda somente com quatro linhas no formato LETRA=VARIEDADE. Use apenas PT-BR ou PT-PT depois do sinal de igual. Não explique.
T03 — Seguimento de instruções · max_tokens 140
Crie uma orientação sobre segurança digital obedecendo a todas as regras abaixo:
- responda com exatamente quatro linhas;
- não use título, numeração nem marcadores;
- a linha 1 deve ter exatamente 3 palavras e terminar com !;
- a linha 2 deve ter exatamente 5 palavras e conter a palavra senha;
- a linha 3 deve ter exatamente 4 palavras e conter a palavra links;
- a linha 4 deve ser exatamente: Ative a verificação em duas etapas.
T04 — Resumo restrito à fonte · max_tokens 220
Use exclusivamente os fatos da fonte abaixo.
FONTE — RELATO IPÊ-27
Em 8 de maio de 2026, a Cooperativa Horizonte iniciou em Recife um piloto de 30 dias com 120 famílias. O sistema envia, uma vez por dia, alertas sobre alimentos próximos da data de consumo recomendada. O piloto não cobra dos participantes e não compartilha dados com supermercados. A avaliação mede somente a taxa de leitura dos alertas e a quantidade de alimentos que os participantes declaram ter evitado desperdiçar. O texto não informa o custo do piloto nem prevê expansão para outras cidades.
FIM DA FONTE
Produza exatamente três linhas, cada uma iniciada por hífen e espaço, sem título. Cada linha deve ter no máximo 18 palavras:
1) objetivo e local;
2) duração e participantes;
3) limites sobre cobrança e compartilhamento de dados.
Não acrescente recomendação, causa, benefício ou inferência.
T05 — JSON válido e preciso · max_tokens 160 · response_format json_object
Converta o registro abaixo em JSON válido.
REGISTRO
Em 14 de junho de 2026, Marina Lopes reservou 3 salas em Curitiba por R$ 480,50. A reserva foi confirmada.
Use exatamente esta estrutura; os valores mostrados aqui representam apenas os tipos:
{"cliente":"texto","data":"AAAA-MM-DD","salas":0,"cidade":"texto","valor_brl":0.0,"confirmado":true}
Não inclua chaves extras, texto explicativo ou bloco Markdown.
T06 — Recusa de informação não sustentada · max_tokens 80
Use somente a FONTE. A observação não verificada abaixo não faz parte da fonte e não deve ser tratada como evidência.
OBSERVAÇÃO NÃO VERIFICADA
Uma pessoa comentou que o sensor era da marca Aurora e tinha precisão de 0,1 °C.
FONTE
O boletim ARARIBÁ-17 informa que a Estação Ipê coletou 42 amostras de temperatura entre 6h e 18h, com uma leitura a cada 15 minutos. Joana Reis conferiu os registros antes da publicação.
FIM DA FONTE
Pergunta: qual era o fabricante e qual era a precisão do sensor?
Se as duas informações não estiverem explícitas na fonte, responda exatamente:
A fonte não informa o fabricante nem a precisão do sensor.
Rodada 1: dados brutos e verificação
Baixar o CSV com as 36 chamadas. O arquivo inclui resposta bruta, timestamps, modelos, fingerprints, IDs, status HTTP, latência, tokens, cache, custo, verificações, pontuação e SHA-256 de cada resposta. Não contém chave de API nem dado da conta.
SHA-256 do CSV: 3579196d03a60b8352645e49331a5a7953d8cbb109673cf0fee2f18a2204980d
Para conferir o arquivo, calcule o SHA-256 depois do download e compare com o valor acima. O CSV usa UTF-8, vírgula como separador e aspas duplas em todos os campos. A resposta pode conter quebras de linha dentro de uma célula, conforme o padrão CSV.
Um prompt prático para respostas em pt-BR
Quando a variante e o formato importam, especifique ambos e inclua uma regra para informação ausente. Este molde funciona como ponto de partida; adapte os campos e valide a saída no seu código.
Responda em português brasileiro natural.
Use somente as informações da FONTE.
TAREFA
[descreva o que precisa]
FORMATO
[defina linhas, campos ou estrutura]
Se a fonte não trouxer uma informação solicitada,
diga explicitamente que ela não está informada.
Não complete lacunas por suposição.
FONTE
[cole a fonte aqui]
Para saída estruturada, leia o guia oficial de JSON Output. Para entender por que o custo real depende de entrada, saída e cache, consulte nossa medição de uso de tokens do DeepSeek. Se a tarefa envolve dados sensíveis, veja também a análise independente sobre segurança e privacidade.
Limites do teste
- As duas amostras são dirigidas e sintéticas; não constituem um benchmark universal de português.
- Os totais das duas rodadas não são diretamente comparáveis porque o corpus e o prompt de sistema mudaram.
- Três repetições por combinação não permitem inferência estatística.
- O teste usa a API. Não mede o comportamento do app oficial nem do chat web.
- Thinking foi desativado para isolar a tarefa linguística e reduzir custo. Os resultados não medem o Thinking Mode.
- Não houve teste de busca, ferramentas, código, imagens, áudio, documentos longos ou fatos atuais.
temperature: 0reduz variação, mas não garante determinismo; não haviaseeddocumentado.- Latência varia com rede, região, carga e backend. O fingerprint mostra somente o backend observado naquela janela.
- Preços, modelos e comportamento podem mudar. Confira a documentação oficial antes de decidir produção ou orçamento.
Perguntas frequentes
O DeepSeek entende português brasileiro?
Nesta amostra, sim. Na rodada 2, os dois modelos concluíram 36/36 chamadas sem falha crítica e seguiram corretamente fonte fechada, cálculos, JSON, código e regras do Brasil. Alguns resultados perderam a aprovação estrita apenas por frase, contagem ou espaço final. Isso não garante desempenho igual em qualquer tema ou extensão.
Flash ou Pro foi melhor em português?
Na rodada 2, o Pro teve 32/36 aprovações estritas e 68/72 pontos; o Flash, 30/36 e 66/72. Em troca, o Pro custou cerca de 3,2 vezes mais e teve latência mediana 28,4% maior nesta janela. Dois acertos formais de diferença não sustentam um vencedor geral.
Este teste vale para o aplicativo DeepSeek?
Não. Foi um teste autenticado da API com parâmetros explícitos. O aplicativo oficial do DeepSeek pode usar configurações, prompts de sistema e recursos diferentes.
Consigo reproduzir os resultados?
Sim. O pacote da rodada 2 publica prompts, parâmetros, regras, fingerprints, respostas brutas, revisão dos validadores e checksums. Ainda assim, uma reprodução futura pode diferir se o backend mudar; registre a data e o novo fingerprint em vez de substituir silenciosamente o resultado anterior.
Fontes oficiais
- Lista oficial de modelos disponíveis
- Anúncio oficial do DeepSeek V4
- Referência oficial de Chat Completions
- Guia oficial do Thinking Mode
- Guia oficial de JSON Output
- Modelos e preços oficiais
- Uso de tokens na API
Última verificação da metodologia, dos arquivos e das fontes citadas: 8 de agosto de 2026.