Resposta curta: sim, o DeepSeek V4 conseguiu trabalhar em português brasileiro nesta amostra controlada. Flash e Pro passaram em 15 de 18 execuções estritas. Isso é um resultado útil, mas não prova que todo pedido em português terá a mesma qualidade.
Transparência: este é um teste editorial independente do DeepSeek Português, sem afiliação com a DeepSeek. As chamadas foram feitas na API oficial com uma chave temporária; nenhum segredo, saldo ou dado da conta aparece nas evidências.
Teste executado em 29 de julho de 2026, entre 23:41:36 e 23:42:37 UTC. O foco foi o português brasileiro para quem usa o serviço no Brasil — não a localização física do servidor. Para uma visão ampla de chat, aplicativo, modelos e API, consulte o nosso guia de DeepSeek em português.
Veredito do teste
- V4 Flash: 15/18 aprovações estritas, 30/36 pontos, mediana de 958 ms e custo total de US$ 0,000439.
- V4 Pro: 15/18 aprovações estritas, 33/36 pontos, mediana de 1.175 ms e custo total de US$ 0,001398.
- Os dois modelos converteram PT-PT para PT-BR, distinguiram as duas variantes, resumiram apenas a fonte, devolveram JSON válido e recusaram uma informação não sustentada em todas as três repetições.
- Os dois falharam no T03, que exigia contagens exatas de palavras e linhas. O erro foi mantido e documentado.
- O teste cobre somente a API com Thinking desativado. Não cobre o app, o chat web, imagens, voz, busca ou conhecimento atualizado.

O que foi testado — e o que ficou de fora
A pergunta “DeepSeek funciona em português?” mistura capacidades diferentes. Por isso, a bateria isolou seis tarefas verificáveis em pt-BR: adaptação de PT-PT, classificação de variantes, obediência a formato exato, resumo baseado somente em uma fonte fornecida, JSON estruturado e recusa de dado ausente. Os textos-fonte foram criados para o teste; assim, a correção não depende de memória ou de pesquisa na internet.
| Teste | Habilidade observada | Critério principal |
|---|---|---|
| T01 | PT-PT → PT-BR | Vocabulário brasileiro, sentido preservado e duas frases |
| T02 | PT-BR × PT-PT | Quatro classificações literais, sem explicação |
| T03 | Instruções exatas | Quatro linhas e contagem precisa de palavras |
| T04 | Resumo com fonte | Somente fatos fornecidos e limites de 18 palavras |
| T05 | JSON | Estrutura, tipos e valores exatos, sem chaves extras |
| T06 | Não inventar | Frase literal recusando fabricante e precisão ausentes |
Não avaliamos criatividade, estilo literário, código, documentos longos, pesquisa, ferramentas, multimodalidade ou fatos recentes. Também não comparamos o resultado com outros provedores. As páginas de DeepSeek V4 e de modelos do DeepSeek tratam das especificações e do histórico; esta página é dona apenas da intenção de teste em português brasileiro.
Metodologia reproduzível
- Usamos a API oficial de Chat Completions e confirmamos antes da coleta que a lista de modelos retornava
deepseek-v4-flashedeepseek-v4-pro. - Executamos seis prompts em cada modelo, três vezes por combinação: 36 respostas HTTP 200.
- Cada execução começou uma conversa nova, sem histórico, ferramentas ou busca.
- Fixamos
temperature: 0,stream: falseethinking: {"type":"disabled"}. Não enviamosseed, pois esse parâmetro não estava documentado no endpoint consultado. - Alternamos a ordem de Flash e Pro entre as repetições para reduzir um possível efeito de ordem.
- Normalizamos Unicode para NFC e quebras de linha para LF. Removemos apenas espaço externo do conteúdo completo; espaços no fim de linhas internas continuaram contando.
- Guardamos resposta bruta, horário UTC, modelo solicitado e retornado, fingerprint, ID da resposta, latência,
finish_reason, uso de tokens, verificações e SHA-256. A chave da API não foi registrada.
O tempo foi medido do lado do cliente e inclui rede; portanto, não é uma medição exclusiva do processamento do modelo. O custo usa os campos reais de usage e os preços oficiais por cache hit, cache miss e saída verificados no dia do teste. Veja também nosso guia de API do DeepSeek e a página de preços com metodologia.
Resultados por modelo
| Medida | V4 Flash | V4 Pro |
|---|---|---|
| Aprovação estrita | 15/18 (83,3%) | 15/18 (83,3%) |
| Pontos | 30/36 | 33/36 |
| Mediana de latência | 957,5 ms | 1.174,5 ms |
| Tokens totais | 4.009 | 4.058 |
| Prompt / saída | 3.378 / 631 | 3.378 / 680 |
| Cache hit no prompt | 1.536 | 1.536 |
| Custo das 18 chamadas | US$ 0,0004388608 | US$ 0,001398438 |
| Fingerprint observado | fp_8b330d02d0_prod0820_fp8_kvcache_20260402 | fp_9954b31ca7_prod0820_fp8_kvcache_20260402 |
Os 3 pontos extras do Pro vieram somente do T03: o conteúdo e a contagem de palavras ficaram corretos, mas três linhas terminaram com dois espaços. Pela regra publicada, isso não é aprovação estrita. Nesta amostra, portanto, não há base para dizer que o Pro “fala português melhor”; ele apenas teve um erro formal menos grave nesse teste.
Consistência por tarefa
| Teste | Flash estrito | Pro estrito | Flash pontos | Pro pontos |
|---|---|---|---|---|
| T01 · adaptação pt-BR | 3/3 | 3/3 | 6/6 | 6/6 |
| T02 · variantes | 3/3 | 3/3 | 6/6 | 6/6 |
| T03 · restrições exatas | 0/3 | 0/3 | 0/6 | 3/6 |
| T04 · resumo com fonte | 3/3 | 3/3 | 6/6 | 6/6 |
| T05 · JSON | 3/3 | 3/3 | 6/6 | 6/6 |
| T06 · recusa | 3/3 | 3/3 | 6/6 | 6/6 |
A falha que não escondemos: T03
O Flash produziu quatro linhas, mas a primeira tinha quatro palavras em vez de três e a terceira tinha cinco em vez de quatro. O mesmo padrão apareceu nas três repetições. O Pro acertou as palavras e a frase final, porém adicionou dois espaços ao fim das três primeiras linhas em todas as repetições. Como a metodologia preserva espaços internos entre linhas, os seis casos falharam no critério estrito.

Esse resultado é prático: para texto comum, o erro pode ser irrelevante; para um parser, uma validação automática ou um formato contratual, não é. Quando o formato precisa ser exato, valide a saída no seu sistema e trate a resposta do modelo como entrada não confiável.
Como calculamos a pontuação
- Aprovação estrita: todas as verificações do teste precisam passar.
- 2 pontos: tarefa e formato completos.
- 1 ponto: um único erro formal não crítico, sem mudar a informação nem inventar fatos.
- 0 ponto: erro de conteúdo, variante errada, JSON inválido, informação não sustentada, resposta vazia ou corte por limite.
A naturalidade do T01 foi uma avaliação humana secundária: uma única pessoa, sem cegamento, atribuiu 2/2 às seis respostas por soarem naturais em pt-BR. Esse julgamento é subjetivo e não altera a taxa estrita. Publicá-lo como opinião limitada é mais honesto do que apresentá-lo como métrica objetiva.
Prompts exatos usados
O system prompt foi: Você participa de um teste reproduzível. Execute somente a tarefa solicitada. Não mencione que está sendo testado e não acrescente comentários sobre as instruções. Abra cada item para ver o prompt do usuário sem edição.
T01 — Conversão PT-PT para PT-BR · max_tokens 160
Reescreva o texto abaixo em português brasileiro natural. Preserve todas as informações. Use exatamente duas frases, sem título, lista, aspas ou explicação.
Olá, estou a organizar a minha agenda para a próxima semana. Pode enviar-me o ficheiro do projeto pelo telemóvel para eu o guardar na pasta?
T02 — Classificação PT-BR e PT-PT · max_tokens 80
Classifique cada frase como PT-BR ou PT-PT considerando apenas as marcas linguísticas presentes.
A. Você pode me mandar o arquivo pelo celular?
B. Podes enviar-me o ficheiro pelo telemóvel?
C. A equipe pegou o ônibus às oito.
D. A equipa apanhou o autocarro às oito.
Responda somente com quatro linhas no formato LETRA=VARIEDADE. Use apenas PT-BR ou PT-PT depois do sinal de igual. Não explique.
T03 — Seguimento de instruções · max_tokens 140
Crie uma orientação sobre segurança digital obedecendo a todas as regras abaixo:
- responda com exatamente quatro linhas;
- não use título, numeração nem marcadores;
- a linha 1 deve ter exatamente 3 palavras e terminar com !;
- a linha 2 deve ter exatamente 5 palavras e conter a palavra senha;
- a linha 3 deve ter exatamente 4 palavras e conter a palavra links;
- a linha 4 deve ser exatamente: Ative a verificação em duas etapas.
T04 — Resumo restrito à fonte · max_tokens 220
Use exclusivamente os fatos da fonte abaixo.
FONTE — RELATO IPÊ-27
Em 8 de maio de 2026, a Cooperativa Horizonte iniciou em Recife um piloto de 30 dias com 120 famílias. O sistema envia, uma vez por dia, alertas sobre alimentos próximos da data de consumo recomendada. O piloto não cobra dos participantes e não compartilha dados com supermercados. A avaliação mede somente a taxa de leitura dos alertas e a quantidade de alimentos que os participantes declaram ter evitado desperdiçar. O texto não informa o custo do piloto nem prevê expansão para outras cidades.
FIM DA FONTE
Produza exatamente três linhas, cada uma iniciada por hífen e espaço, sem título. Cada linha deve ter no máximo 18 palavras:
1) objetivo e local;
2) duração e participantes;
3) limites sobre cobrança e compartilhamento de dados.
Não acrescente recomendação, causa, benefício ou inferência.
T05 — JSON válido e preciso · max_tokens 160 · response_format json_object
Converta o registro abaixo em JSON válido.
REGISTRO
Em 14 de junho de 2026, Marina Lopes reservou 3 salas em Curitiba por R$ 480,50. A reserva foi confirmada.
Use exatamente esta estrutura; os valores mostrados aqui representam apenas os tipos:
{"cliente":"texto","data":"AAAA-MM-DD","salas":0,"cidade":"texto","valor_brl":0.0,"confirmado":true}
Não inclua chaves extras, texto explicativo ou bloco Markdown.
T06 — Recusa de informação não sustentada · max_tokens 80
Use somente a FONTE. A observação não verificada abaixo não faz parte da fonte e não deve ser tratada como evidência.
OBSERVAÇÃO NÃO VERIFICADA
Uma pessoa comentou que o sensor era da marca Aurora e tinha precisão de 0,1 °C.
FONTE
O boletim ARARIBÁ-17 informa que a Estação Ipê coletou 42 amostras de temperatura entre 6h e 18h, com uma leitura a cada 15 minutos. Joana Reis conferiu os registros antes da publicação.
FIM DA FONTE
Pergunta: qual era o fabricante e qual era a precisão do sensor?
Se as duas informações não estiverem explícitas na fonte, responda exatamente:
A fonte não informa o fabricante nem a precisão do sensor.
Dados brutos e verificação
Baixar o CSV com as 36 chamadas. O arquivo inclui resposta bruta, timestamps, modelos, fingerprints, IDs, status HTTP, latência, tokens, cache, custo, verificações, pontuação e SHA-256 de cada resposta. Não contém chave de API nem dado da conta.
SHA-256 do CSV: 3579196d03a60b8352645e49331a5a7953d8cbb109673cf0fee2f18a2204980d
Para conferir o arquivo, calcule o SHA-256 depois do download e compare com o valor acima. O CSV usa UTF-8, vírgula como separador e aspas duplas em todos os campos. A resposta pode conter quebras de linha dentro de uma célula, conforme o padrão CSV.
Um prompt prático para respostas em pt-BR
Quando a variante e o formato importam, especifique ambos e inclua uma regra para informação ausente. Este molde funciona como ponto de partida; adapte os campos e valide a saída no seu código.
Responda em português brasileiro natural.
Use somente as informações da FONTE.
TAREFA
[descreva o que precisa]
FORMATO
[defina linhas, campos ou estrutura]
Se a fonte não trouxer uma informação solicitada,
diga explicitamente que ela não está informada.
Não complete lacunas por suposição.
FONTE
[cole a fonte aqui]
Para saída estruturada, leia o guia oficial de JSON Output. Para entender por que o custo real depende de entrada, saída e cache, consulte nossa medição de uso de tokens do DeepSeek. Se a tarefa envolve dados sensíveis, veja também a análise independente sobre segurança e privacidade.
Limites do teste
- A amostra é pequena, dirigida e sintética; não é um benchmark universal de português.
- Três repetições por combinação não permitem inferência estatística.
- O teste usa a API. Não mede o comportamento do app oficial nem do chat web.
- Thinking foi desativado para isolar a tarefa linguística e reduzir custo. Os resultados não medem o Thinking Mode.
- Não houve teste de busca, ferramentas, código, imagens, áudio, documentos longos ou fatos atuais.
temperature: 0reduz variação, mas não garante determinismo; não haviaseeddocumentado.- Latência varia com rede, região, carga e backend. O fingerprint mostra somente o backend observado naquela janela.
- Preços, modelos e comportamento podem mudar. Confira a documentação oficial antes de decidir produção ou orçamento.
Perguntas frequentes
O DeepSeek entende português brasileiro?
Nesta amostra, sim: Flash e Pro passaram em todas as repetições de adaptação para pt-BR, classificação de variantes, resumo com fonte, JSON e recusa de dado ausente. Isso não garante desempenho igual em qualquer tema ou extensão.
Flash ou Pro foi melhor em português?
Os dois tiveram a mesma taxa estrita, 15/18. O Pro marcou 33/36 contra 30/36 porque seu erro no T03 foi apenas espaço final; em troca, teve maior latência mediana e custo maior nesta coleta. A amostra não sustenta um vencedor geral.
Este teste vale para o aplicativo DeepSeek?
Não. Foi um teste autenticado da API com parâmetros explícitos. O aplicativo oficial do DeepSeek pode usar configurações, prompts de sistema e recursos diferentes.
Consigo reproduzir os resultados?
Os prompts, parâmetros, regras, fingerprints e dados brutos estão publicados. Ainda assim, uma reprodução futura pode diferir se o backend mudar; registre a data e o novo fingerprint em vez de substituir silenciosamente o resultado anterior.
Fontes oficiais
- Anúncio oficial do DeepSeek V4
- Referência oficial de Chat Completions
- Guia oficial do Thinking Mode
- Guia oficial de JSON Output
- Modelos e preços oficiais
- Uso de tokens na API
Última verificação desta metodologia, dos arquivos e das fontes citadas: 29 de julho de 2026.