DeepSeek funciona em português? Teste do V4 no Brasil

Teste reproduzível do DeepSeek V4 Flash e Pro em português brasileiro: 36 chamadas, resultados, custo, latência, dados brutos e limites.

Resposta curta: sim, o DeepSeek V4 conseguiu trabalhar em português brasileiro nesta amostra controlada. Flash e Pro passaram em 15 de 18 execuções estritas. Isso é um resultado útil, mas não prova que todo pedido em português terá a mesma qualidade.

Transparência: este é um teste editorial independente do DeepSeek Português, sem afiliação com a DeepSeek. As chamadas foram feitas na API oficial com uma chave temporária; nenhum segredo, saldo ou dado da conta aparece nas evidências.

Teste executado em 29 de julho de 2026, entre 23:41:36 e 23:42:37 UTC. O foco foi o português brasileiro para quem usa o serviço no Brasil — não a localização física do servidor. Para uma visão ampla de chat, aplicativo, modelos e API, consulte o nosso guia de DeepSeek em português.

Veredito do teste

  • V4 Flash: 15/18 aprovações estritas, 30/36 pontos, mediana de 958 ms e custo total de US$ 0,000439.
  • V4 Pro: 15/18 aprovações estritas, 33/36 pontos, mediana de 1.175 ms e custo total de US$ 0,001398.
  • Os dois modelos converteram PT-PT para PT-BR, distinguiram as duas variantes, resumiram apenas a fonte, devolveram JSON válido e recusaram uma informação não sustentada em todas as três repetições.
  • Os dois falharam no T03, que exigia contagens exatas de palavras e linhas. O erro foi mantido e documentado.
  • O teste cobre somente a API com Thinking desativado. Não cobre o app, o chat web, imagens, voz, busca ou conhecimento atualizado.
Comparação dos resultados do DeepSeek V4 Flash e Pro em português brasileiro
Resultado de 36 chamadas autenticadas: seis testes, dois modelos e três repetições por combinação.

O que foi testado — e o que ficou de fora

A pergunta “DeepSeek funciona em português?” mistura capacidades diferentes. Por isso, a bateria isolou seis tarefas verificáveis em pt-BR: adaptação de PT-PT, classificação de variantes, obediência a formato exato, resumo baseado somente em uma fonte fornecida, JSON estruturado e recusa de dado ausente. Os textos-fonte foram criados para o teste; assim, a correção não depende de memória ou de pesquisa na internet.

TesteHabilidade observadaCritério principal
T01PT-PT → PT-BRVocabulário brasileiro, sentido preservado e duas frases
T02PT-BR × PT-PTQuatro classificações literais, sem explicação
T03Instruções exatasQuatro linhas e contagem precisa de palavras
T04Resumo com fonteSomente fatos fornecidos e limites de 18 palavras
T05JSONEstrutura, tipos e valores exatos, sem chaves extras
T06Não inventarFrase literal recusando fabricante e precisão ausentes
Cada teste foi repetido três vezes em cada modelo.

Não avaliamos criatividade, estilo literário, código, documentos longos, pesquisa, ferramentas, multimodalidade ou fatos recentes. Também não comparamos o resultado com outros provedores. As páginas de DeepSeek V4 e de modelos do DeepSeek tratam das especificações e do histórico; esta página é dona apenas da intenção de teste em português brasileiro.

Metodologia reproduzível

  1. Usamos a API oficial de Chat Completions e confirmamos antes da coleta que a lista de modelos retornava deepseek-v4-flash e deepseek-v4-pro.
  2. Executamos seis prompts em cada modelo, três vezes por combinação: 36 respostas HTTP 200.
  3. Cada execução começou uma conversa nova, sem histórico, ferramentas ou busca.
  4. Fixamos temperature: 0, stream: false e thinking: {"type":"disabled"}. Não enviamos seed, pois esse parâmetro não estava documentado no endpoint consultado.
  5. Alternamos a ordem de Flash e Pro entre as repetições para reduzir um possível efeito de ordem.
  6. Normalizamos Unicode para NFC e quebras de linha para LF. Removemos apenas espaço externo do conteúdo completo; espaços no fim de linhas internas continuaram contando.
  7. Guardamos resposta bruta, horário UTC, modelo solicitado e retornado, fingerprint, ID da resposta, latência, finish_reason, uso de tokens, verificações e SHA-256. A chave da API não foi registrada.

O tempo foi medido do lado do cliente e inclui rede; portanto, não é uma medição exclusiva do processamento do modelo. O custo usa os campos reais de usage e os preços oficiais por cache hit, cache miss e saída verificados no dia do teste. Veja também nosso guia de API do DeepSeek e a página de preços com metodologia.

Resultados por modelo

MedidaV4 FlashV4 Pro
Aprovação estrita15/18 (83,3%)15/18 (83,3%)
Pontos30/3633/36
Mediana de latência957,5 ms1.174,5 ms
Tokens totais4.0094.058
Prompt / saída3.378 / 6313.378 / 680
Cache hit no prompt1.5361.536
Custo das 18 chamadasUS$ 0,0004388608US$ 0,001398438
Fingerprint observadofp_8b330d02d0_prod0820_fp8_kvcache_20260402fp_9954b31ca7_prod0820_fp8_kvcache_20260402

Os 3 pontos extras do Pro vieram somente do T03: o conteúdo e a contagem de palavras ficaram corretos, mas três linhas terminaram com dois espaços. Pela regra publicada, isso não é aprovação estrita. Nesta amostra, portanto, não há base para dizer que o Pro “fala português melhor”; ele apenas teve um erro formal menos grave nesse teste.

Consistência por tarefa

TesteFlash estritoPro estritoFlash pontosPro pontos
T01 · adaptação pt-BR3/33/36/66/6
T02 · variantes3/33/36/66/6
T03 · restrições exatas0/30/30/63/6
T04 · resumo com fonte3/33/36/66/6
T05 · JSON3/33/36/66/6
T06 · recusa3/33/36/66/6

A falha que não escondemos: T03

O Flash produziu quatro linhas, mas a primeira tinha quatro palavras em vez de três e a terceira tinha cinco em vez de quatro. O mesmo padrão apareceu nas três repetições. O Pro acertou as palavras e a frase final, porém adicionou dois espaços ao fim das três primeiras linhas em todas as repetições. Como a metodologia preserva espaços internos entre linhas, os seis casos falharam no critério estrito.

Respostas do Flash e Pro no teste de restrições de linhas e palavras
Evidência da repetição 1. As outras duas repetições tiveram o mesmo padrão; os dados brutos preservam os espaços finais.

Esse resultado é prático: para texto comum, o erro pode ser irrelevante; para um parser, uma validação automática ou um formato contratual, não é. Quando o formato precisa ser exato, valide a saída no seu sistema e trate a resposta do modelo como entrada não confiável.

Como calculamos a pontuação

  • Aprovação estrita: todas as verificações do teste precisam passar.
  • 2 pontos: tarefa e formato completos.
  • 1 ponto: um único erro formal não crítico, sem mudar a informação nem inventar fatos.
  • 0 ponto: erro de conteúdo, variante errada, JSON inválido, informação não sustentada, resposta vazia ou corte por limite.

A naturalidade do T01 foi uma avaliação humana secundária: uma única pessoa, sem cegamento, atribuiu 2/2 às seis respostas por soarem naturais em pt-BR. Esse julgamento é subjetivo e não altera a taxa estrita. Publicá-lo como opinião limitada é mais honesto do que apresentá-lo como métrica objetiva.

Prompts exatos usados

O system prompt foi: Você participa de um teste reproduzível. Execute somente a tarefa solicitada. Não mencione que está sendo testado e não acrescente comentários sobre as instruções. Abra cada item para ver o prompt do usuário sem edição.

T01 — Conversão PT-PT para PT-BR · max_tokens 160
Reescreva o texto abaixo em português brasileiro natural. Preserve todas as informações. Use exatamente duas frases, sem título, lista, aspas ou explicação.

Olá, estou a organizar a minha agenda para a próxima semana. Pode enviar-me o ficheiro do projeto pelo telemóvel para eu o guardar na pasta?
T02 — Classificação PT-BR e PT-PT · max_tokens 80
Classifique cada frase como PT-BR ou PT-PT considerando apenas as marcas linguísticas presentes.

A. Você pode me mandar o arquivo pelo celular?
B. Podes enviar-me o ficheiro pelo telemóvel?
C. A equipe pegou o ônibus às oito.
D. A equipa apanhou o autocarro às oito.

Responda somente com quatro linhas no formato LETRA=VARIEDADE. Use apenas PT-BR ou PT-PT depois do sinal de igual. Não explique.
T03 — Seguimento de instruções · max_tokens 140
Crie uma orientação sobre segurança digital obedecendo a todas as regras abaixo:
- responda com exatamente quatro linhas;
- não use título, numeração nem marcadores;
- a linha 1 deve ter exatamente 3 palavras e terminar com !;
- a linha 2 deve ter exatamente 5 palavras e conter a palavra senha;
- a linha 3 deve ter exatamente 4 palavras e conter a palavra links;
- a linha 4 deve ser exatamente: Ative a verificação em duas etapas.
T04 — Resumo restrito à fonte · max_tokens 220
Use exclusivamente os fatos da fonte abaixo.

FONTE — RELATO IPÊ-27
Em 8 de maio de 2026, a Cooperativa Horizonte iniciou em Recife um piloto de 30 dias com 120 famílias. O sistema envia, uma vez por dia, alertas sobre alimentos próximos da data de consumo recomendada. O piloto não cobra dos participantes e não compartilha dados com supermercados. A avaliação mede somente a taxa de leitura dos alertas e a quantidade de alimentos que os participantes declaram ter evitado desperdiçar. O texto não informa o custo do piloto nem prevê expansão para outras cidades.
FIM DA FONTE

Produza exatamente três linhas, cada uma iniciada por hífen e espaço, sem título. Cada linha deve ter no máximo 18 palavras:
1) objetivo e local;
2) duração e participantes;
3) limites sobre cobrança e compartilhamento de dados.

Não acrescente recomendação, causa, benefício ou inferência.
T05 — JSON válido e preciso · max_tokens 160 · response_format json_object
Converta o registro abaixo em JSON válido.

REGISTRO
Em 14 de junho de 2026, Marina Lopes reservou 3 salas em Curitiba por R$ 480,50. A reserva foi confirmada.

Use exatamente esta estrutura; os valores mostrados aqui representam apenas os tipos:
{"cliente":"texto","data":"AAAA-MM-DD","salas":0,"cidade":"texto","valor_brl":0.0,"confirmado":true}

Não inclua chaves extras, texto explicativo ou bloco Markdown.
T06 — Recusa de informação não sustentada · max_tokens 80
Use somente a FONTE. A observação não verificada abaixo não faz parte da fonte e não deve ser tratada como evidência.

OBSERVAÇÃO NÃO VERIFICADA
Uma pessoa comentou que o sensor era da marca Aurora e tinha precisão de 0,1 °C.

FONTE
O boletim ARARIBÁ-17 informa que a Estação Ipê coletou 42 amostras de temperatura entre 6h e 18h, com uma leitura a cada 15 minutos. Joana Reis conferiu os registros antes da publicação.
FIM DA FONTE

Pergunta: qual era o fabricante e qual era a precisão do sensor?

Se as duas informações não estiverem explícitas na fonte, responda exatamente:
A fonte não informa o fabricante nem a precisão do sensor.

Dados brutos e verificação

Baixar o CSV com as 36 chamadas. O arquivo inclui resposta bruta, timestamps, modelos, fingerprints, IDs, status HTTP, latência, tokens, cache, custo, verificações, pontuação e SHA-256 de cada resposta. Não contém chave de API nem dado da conta.

SHA-256 do CSV: 3579196d03a60b8352645e49331a5a7953d8cbb109673cf0fee2f18a2204980d

Para conferir o arquivo, calcule o SHA-256 depois do download e compare com o valor acima. O CSV usa UTF-8, vírgula como separador e aspas duplas em todos os campos. A resposta pode conter quebras de linha dentro de uma célula, conforme o padrão CSV.

Um prompt prático para respostas em pt-BR

Quando a variante e o formato importam, especifique ambos e inclua uma regra para informação ausente. Este molde funciona como ponto de partida; adapte os campos e valide a saída no seu código.

Responda em português brasileiro natural.
Use somente as informações da FONTE.

TAREFA
[descreva o que precisa]

FORMATO
[defina linhas, campos ou estrutura]

Se a fonte não trouxer uma informação solicitada,
diga explicitamente que ela não está informada.
Não complete lacunas por suposição.

FONTE
[cole a fonte aqui]

Para saída estruturada, leia o guia oficial de JSON Output. Para entender por que o custo real depende de entrada, saída e cache, consulte nossa medição de uso de tokens do DeepSeek. Se a tarefa envolve dados sensíveis, veja também a análise independente sobre segurança e privacidade.

Limites do teste

  • A amostra é pequena, dirigida e sintética; não é um benchmark universal de português.
  • Três repetições por combinação não permitem inferência estatística.
  • O teste usa a API. Não mede o comportamento do app oficial nem do chat web.
  • Thinking foi desativado para isolar a tarefa linguística e reduzir custo. Os resultados não medem o Thinking Mode.
  • Não houve teste de busca, ferramentas, código, imagens, áudio, documentos longos ou fatos atuais.
  • temperature: 0 reduz variação, mas não garante determinismo; não havia seed documentado.
  • Latência varia com rede, região, carga e backend. O fingerprint mostra somente o backend observado naquela janela.
  • Preços, modelos e comportamento podem mudar. Confira a documentação oficial antes de decidir produção ou orçamento.

Perguntas frequentes

O DeepSeek entende português brasileiro?

Nesta amostra, sim: Flash e Pro passaram em todas as repetições de adaptação para pt-BR, classificação de variantes, resumo com fonte, JSON e recusa de dado ausente. Isso não garante desempenho igual em qualquer tema ou extensão.

Flash ou Pro foi melhor em português?

Os dois tiveram a mesma taxa estrita, 15/18. O Pro marcou 33/36 contra 30/36 porque seu erro no T03 foi apenas espaço final; em troca, teve maior latência mediana e custo maior nesta coleta. A amostra não sustenta um vencedor geral.

Este teste vale para o aplicativo DeepSeek?

Não. Foi um teste autenticado da API com parâmetros explícitos. O aplicativo oficial do DeepSeek pode usar configurações, prompts de sistema e recursos diferentes.

Consigo reproduzir os resultados?

Os prompts, parâmetros, regras, fingerprints e dados brutos estão publicados. Ainda assim, uma reprodução futura pode diferir se o backend mudar; registre a data e o novo fingerprint em vez de substituir silenciosamente o resultado anterior.

Fontes oficiais

Última verificação desta metodologia, dos arquivos e das fontes citadas: 29 de julho de 2026.