DeepSeek Math é a forma comum de se referir ao DeepSeekMath, uma família histórica de checkpoints da DeepSeek voltada a raciocínio matemático. A linha DeepSeekMath 7B inclui versões Base, Instruct e RL, disponibilizadas para pesquisa e execução própria. Ela pode produzir soluções em linguagem natural e código auxiliar, mas não oferece garantia de correção matemática.
Status verificado:
deepseek-mathe os IDs dos checkpoints DeepSeekMath não são modelos da API hospedada da DeepSeek. Os IDs hospedados documentados em 19 de julho de 2026 sãodeepseek-v4-flashedeepseek-v4-pro. Para chamadas ao serviço oficial, consulte DeepSeek V4 e o guia da API. Esta página trata dos pesos da família matemática para inferência administrada pelo próprio usuário.
Última verificação editorial e técnica: 19 de julho de 2026.
Resumo técnico
| Item | Informação verificada |
|---|---|
| Projeto original | DeepSeekMath 7B, apresentado em 2024 |
| Base inicial | DeepSeek-Coder-Base-v1.5 7B |
| Pré-treinamento continuado | 500 bilhões de tokens no total, incluindo corpus matemático de 120 bilhões de tokens |
| Corpus matemático divulgado | 35,5 milhões de páginas matemáticas obtidas por pipeline de seleção a partir do Common Crawl |
| Variantes públicas | Base 7B, Instruct 7B e RL 7B |
| Comprimento de sequência | 4.096 tokens nos três checkpoints 7B listados oficialmente |
| Técnica associada | Group Relative Policy Optimization, ou GRPO, na etapa de reinforcement learning |
| Acesso | Checkpoints de pesos; não é um ID da API hospedada |
| Licenças do projeto 7B | Código sob MIT; pesos sob licença de modelo separada |
Nesta página
- O que é DeepSeekMath
- Dados e pré-treinamento
- Base, Instruct e RL
- O que é GRPO
- Como interpretar os resultados publicados
- Execução local com Transformers
- Pipeline de validação matemática
- Onde DeepSeekMath-V2 se encaixa
- Licenças e uso responsável
O que é DeepSeekMath
DeepSeekMath é uma linha de modelos de linguagem especializada em raciocínio matemático. Em vez de funcionar como uma calculadora determinística, o modelo gera tokens que representam uma tentativa de solução. Ele pode interpretar um enunciado textual, organizar uma derivação, produzir notação LaTeX ou escrever um programa para auxiliar um cálculo.
Essa capacidade é útil para pesquisa e prototipagem, mas cria uma distinção essencial:
- gerar uma solução significa produzir uma sequência plausível de passos;
- verificar uma solução significa demonstrar que cada passo preserva as hipóteses e leva validamente à conclusão.
O modelo pode chegar a uma resposta final correta por um argumento inválido, ou cometer um pequeno erro algébrico depois de várias etapas corretas. Por isso, DeepSeekMath deve ser integrado a um processo de verificação independente, especialmente em provas, pesquisa, material didático, engenharia e qualquer aplicação com consequência real.
DeepSeekMath também não é sinônimo de chat, calculadora ou API. O checkpoint contém pesos e configurações. O runtime carrega esses arquivos. Uma interface coleta o prompt e apresenta a resposta. Se houver execução de código ou consulta a uma ferramenta simbólica, isso é realizado por componentes externos.
Dados e pré-treinamento
O DeepSeekMath 7B foi inicializado a partir do DeepSeek-Coder-Base-v1.5 7B e passou por pré-treinamento continuado. O repositório oficial informa 500 bilhões de tokens nessa etapa, combinando dados matemáticos, linguagem natural e código. Dentro desse processo, a equipe construiu um corpus matemático de 120 bilhões de tokens, extraído de 35,5 milhões de páginas.
O pipeline de coleta descrito seguiu um ciclo iterativo:
- usar um corpus matemático inicial como conjunto positivo para treinar um classificador fastText;
- recuperar páginas matemáticas de uma versão deduplicada do Common Crawl;
- identificar domínios potencialmente relevantes por análise estatística;
- anotar URLs e ampliar o conjunto com páginas relacionadas;
- repetir o treinamento e a coleta em quatro iterações.
O fato de o corpus ser amplo não implica cobertura completa, ausência de erros ou equivalência entre idiomas e áreas da matemática. Dados da web podem conter soluções incompletas, notação inconsistente e duplicações residuais. Ao avaliar o checkpoint, separe desempenho por idioma, domínio, dificuldade e formato do enunciado.
Base, Instruct e RL
| Checkpoint | Função no projeto | Uso técnico típico | Formato de interação |
|---|---|---|---|
deepseek-math-7b-base | Modelo após pré-treinamento continuado | Avaliação, completion, pesquisa e fine-tuning | Prefixo textual; não presumir comportamento de assistente |
deepseek-math-7b-instruct | Ajuste por instruções sobre o modelo Base | Soluções orientadas por enunciado e protótipos conversacionais | Template de chat do tokenizer, sem system prompt |
deepseek-math-7b-rl | Treinamento por reforço a partir do Instruct | Pesquisa sobre raciocínio passo a passo e GRPO | Prompt de raciocínio recomendado pelo projeto |
Os três checkpoints listados no repositório têm sequência máxima publicada de 4.096 tokens. Esse limite inclui entrada e geração. Um enunciado longo, exemplos, instruções e resposta detalhada competem pelo mesmo orçamento; quando o limite é ultrapassado, o runtime pode truncar informações ou impedir a geração.
Use Base quando o experimento controla diretamente o formato e mede completion. Use Instruct quando a entrada é uma tarefa descrita por uma pessoa. Use RL quando o objetivo envolve reproduzir ou estudar o comportamento obtido pela etapa de reinforcement learning. Não reutilize o mesmo template cegamente entre variantes.
O que é GRPO no DeepSeekMath
GRPO significa Group Relative Policy Optimization. O artigo do DeepSeekMath apresenta o método como uma variante de Proximal Policy Optimization para reinforcement learning. Em termos práticos, o treinamento gera um grupo de respostas para o mesmo problema, calcula recompensas e usa o desempenho relativo dentro do grupo para estimar a vantagem de cada resposta.
O desenho elimina a necessidade de um modelo crítico do mesmo porte usado para estimar valores no PPO tradicional. Isso reduz consumo de memória durante o treinamento. O algoritmo ainda usa restrições de atualização para evitar que a política se afaste demais da referência.
GRPO é um método de otimização, não um verificador matemático e não uma prova de correção. A qualidade final depende dos problemas de treinamento, funções de recompensa, critérios de formatação, cobertura dos dados e configuração de inferência. Em uma aplicação, a resposta continua precisando de validação externa.
Como interpretar os resultados publicados
O artigo técnico registra 51,7% no benchmark MATH sem ferramentas externas e sem votação. Com self-consistency sobre 64 amostras, o resultado publicado chega a 60,9%. Esses números descrevem o protocolo do trabalho; não devem ser apresentados como taxa geral de acerto para perguntas matemáticas.
Self-consistency gera várias soluções e seleciona uma resposta recorrente. Isso aumenta o custo de inferência e pode melhorar uma métrica de resposta final, mas não demonstra que a justificativa escolhida é válida. Muitas amostras podem repetir a mesma falha ou convergir para uma resposta errada.
Ao reproduzir um benchmark, documente:
- checkpoint e revisão exatos;
- template, idioma e exemplos adicionados ao prompt;
- temperatura, top-p, número de amostras e limite de geração;
- critério de extração e normalização da resposta;
- uso ou ausência de calculadora, código ou sistema algébrico;
- hardware, runtime, precisão numérica e semente;
- versão do conjunto de problemas e tratamento de itens inválidos.
Para avaliação própria, mantenha um conjunto oculto e faça revisão manual de uma amostra. A métrica de resposta final deve ser acompanhada por validade das etapas, consistência de hipóteses, uso correto de unidades e robustez a pequenas alterações do enunciado.
Execução local com Transformers
O exemplo abaixo carrega o checkpoint Instruct com PyTorch e Transformers. A documentação oficial desta linha não recomenda incluir uma mensagem de sistema. O prompt mantém o formato de raciocínio em inglês recomendado pelo projeto para avaliações; se sua aplicação atende usuários em português, crie um conjunto PT-BR separado e meça a qualidade antes de lançar.
python -m pip install torch transformers accelerate safetensors
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer, GenerationConfig
MODEL_ID = "deepseek-ai/deepseek-math-7b-instruct"
tokenizer = AutoTokenizer.from_pretrained(MODEL_ID)
model = AutoModelForCausalLM.from_pretrained(
MODEL_ID,
torch_dtype=torch.bfloat16,
device_map="auto",
)
model.generation_config = GenerationConfig.from_pretrained(MODEL_ID)
model.generation_config.pad_token_id = model.generation_config.eos_token_id
question = """Find all integer solutions of x^2 - y^2 = 45.
Please reason step by step, and put your final answer within \\boxed{}."""
messages = [{"role": "user", "content": question}]
input_ids = tokenizer.apply_chat_template(
messages,
add_generation_prompt=True,
return_tensors="pt",
).to(model.device)
with torch.inference_mode():
output_ids = model.generate(
input_ids,
max_new_tokens=768,
do_sample=False,
)
answer = tokenizer.decode(
output_ids[0][input_ids.shape[1]:],
skip_special_tokens=True,
)
print(answer)
bfloat16 exige hardware compatível. Em outro ambiente, selecione uma precisão suportada e teste estabilidade e memória. Não publique uma estimativa genérica de VRAM como requisito universal: pesos, cache KV, comprimento de entrada, lote, runtime e overhead alteram o consumo.
Para produção, fixe uma revisão imutável do modelo, as versões das bibliotecas e os hashes dos arquivos. O exemplo usa o repositório principal para facilitar a leitura; isso não é suficiente para reproduzir uma avaliação meses depois.
Prompt técnico em português
Resolva o problema abaixo e trate explicitamente todas as hipóteses.
Requisitos:
1. defina as variáveis e o domínio;
2. justifique cada transformação;
3. teste casos de borda;
4. substitua a resposta na expressão original;
5. se não puder verificar um passo, marque-o como não verificado;
6. coloque o resultado final entre \\boxed{}.
Problema:
[insira o enunciado]
Esse prompt torna a resposta mais auditável, mas não força verdade. Faça testes específicos para português brasileiro, incluindo vírgula decimal, unidades, terminologia local e ambiguidades linguísticas. Não misture uma avaliação em inglês com alegações de desempenho em português.
Pipeline de validação matemática
Uma aplicação robusta separa geração, extração e verificação. O modelo propõe uma solução; componentes independentes conferem o que puder ser formalizado; uma pessoa revisa o que permanece aberto.
- Normalize o enunciado: preserve hipóteses, domínio, unidades e notação original.
- Gere uma solução estruturada: separe premissas, passos e resposta final.
- Extraia afirmações verificáveis: equações, desigualdades, intervalos e valores numéricos.
- Verifique por método independente: substituição direta, cálculo exato, sistema algébrico, provador formal ou teste numérico com tolerância declarada.
- Procure contraexemplos: teste fronteiras, sinais, denominadores nulos e condições esquecidas.
- Revise a prova: uma resposta final correta não valida automaticamente as etapas.
- Registre incerteza: não converta uma etapa não verificada em afirmação definitiva.
Matriz mínima de avaliação
| Dimensão | Teste | Falha que revela |
|---|---|---|
| Resposta final | Comparação exata ou normalizada | Valor incorreto |
| Derivação | Revisão de cada implicação | Passo inválido com resultado correto |
| Domínio | Checagem de restrições e soluções extraviadas | Divisão por zero, raiz inválida ou solução espúria |
| Robustez | Paráfrases e pequenas variações dos números | Dependência de padrão superficial |
| Idioma | Conjunto PT-BR revisado por especialista | Erro de interpretação ou notação |
| Reprodutibilidade | Reexecução com configuração registrada | Resultado dependente de ambiente desconhecido |
| Abstenção | Problemas incompletos ou contraditórios | Resposta inventada quando faltam dados |
Em educação, use o modelo para criar rascunhos de explicações, pistas graduais ou variações de exercícios, sempre com revisão docente. Não o use para atribuir nota automaticamente a uma prova aberta sem rubrica, validação e mecanismo de contestação.
Limitações que devem aparecer no produto
- Erros de raciocínio: uma explicação fluente pode conter uma implicação falsa.
- Erros aritméticos: operações simples podem falhar dentro de uma solução longa.
- Hipóteses omitidas: domínio, sinal, continuidade ou condições de existência podem desaparecer.
- Notação ambígua: símbolos podem ser redefinidos ou usados de forma inconsistente.
- Contexto limitado: a sequência publicada de 4.096 tokens restringe problemas e provas longas.
- Entrada textual: o checkpoint não interpreta uma figura geométrica apenas porque ela foi mencionada; a informação precisa chegar em formato que o modelo aceite.
- Execução externa: código sugerido não é executado ou validado pelo modelo.
A interface deve informar que a resposta é gerada por IA, pode conter erros e exige conferência. Em aplicações acadêmicas ou profissionais, registre a origem da resposta e não apresente conteúdo gerado como revisão de um matemático.
Onde DeepSeekMath-V2 se encaixa
DeepSeekMath-V2 é um projeto posterior da mesma linha de pesquisa, centrado em raciocínio matemático autoverificável e provas. A documentação oficial informa que ele foi construído sobre DeepSeek-V3.2-Exp-Base. O model card lista 685 bilhões de parâmetros e apresenta resultados de competições obtidos com escalonamento de computação no momento da inferência.
Ele deve ser tratado como um artefato distinto, com arquitetura, runtime, escala e licença próprios. Não substitua deepseek-math-7b-instruct por DeepSeek-Math-V2 em um script e espere o mesmo consumo ou comportamento. Antes de qualquer teste, siga o suporte de inferência indicado pelo repositório e dimensione infraestrutura compatível.
DeepSeekMath-V2 também não é um ID da API hospedada. Resultados de competição publicados descrevem o protocolo de pesquisa e não garantem a correção de toda prova produzida. O próprio material do projeto afirma que ainda há trabalho a fazer nessa direção.
Licenças e uso responsável
No projeto DeepSeekMath 7B, o código do repositório usa licença MIT, enquanto os modelos seguem uma licença separada. O repositório informa que o uso comercial é permitido sob esses termos. Já o model card oficial do DeepSeekMath-V2 identifica licença Apache 2.0 para o repositório e os pesos daquela versão.
A licença deve ser conferida no artefato exato que será usado. Quantizações e conversões hospedadas por terceiros podem adicionar outra camada de procedência e termos. Registre origem, revisão, licença, modificações e avisos exigidos antes de redistribuir pesos ou integrar o modelo a um produto.
Pesos disponíveis e código de repositório não tornam toda a plataforma DeepSeek aberta sob uma licença única. API, chat, marca, código, pesos e artefatos derivados têm regras diferentes. Consulte a página geral de modelos DeepSeek para manter essa separação ao navegar entre famílias.
Perguntas frequentes
DeepSeek Math é um ID da API?
Não. DeepSeekMath é uma família de checkpoints para execução própria. A API hospedada aceita os IDs publicados no catálogo oficial, que na data da verificação são deepseek-v4-flash e deepseek-v4-pro.
Qual variante 7B devo usar?
Base é apropriado para completion, fine-tuning e avaliação controlada. Instruct atende prompts em linguagem natural. RL é indicado para pesquisa sobre o comportamento obtido com reinforcement learning e GRPO.
GRPO garante respostas matemáticas corretas?
Não. GRPO é um método de treinamento. Uma resposta gerada continua sujeita a erros de cálculo, lógica, domínio e interpretação.
DeepSeekMath funciona em português?
O modelo pode gerar texto em português, mas a qualidade não deve ser presumida a partir de resultados em outros idiomas. Avalie um conjunto PT-BR revisado por especialista, incluindo notação e vocabulário locais.
Posso confiar em uma resposta se o resultado final estiver correto?
Não automaticamente. Verifique as hipóteses e cada transformação. Uma cadeia de raciocínio inválida pode chegar ao resultado correto por coincidência ou cancelamento de erros.
O projeto permite uso comercial?
O repositório DeepSeekMath 7B declara suporte a uso comercial sob a licença do modelo. Leia os termos do checkpoint, do código e de qualquer artefato derivado antes da implantação.
Conclusão
DeepSeek Math é relevante para desenvolvedores e pesquisadores que desejam estudar modelos matemáticos de pesos disponíveis, reproduzir experimentos com Base, Instruct e RL ou construir um protótipo local. Seu uso responsável exige separar geração de verificação, registrar a configuração, avaliar português com dados próprios e nunca confundir o checkpoint com um modelo da API hospedada.
Comece por um problema bem definido, use o template correto do checkpoint e mantenha uma etapa independente de validação. Se a aplicação precisa de serviço gerenciado, utilize um ID suportado pela API. Se precisa dos pesos históricos, planeje infraestrutura, segurança, licenças e revisão matemática antes de disponibilizar respostas a usuários.
Fontes oficiais e primárias
- Repositório oficial do DeepSeekMath 7B
- Artigo técnico DeepSeekMath
- Model card oficial do DeepSeekMath 7B Instruct
- Licença do código do projeto 7B
- Licença dos modelos DeepSeekMath 7B
- Model card oficial do DeepSeekMath-V2
- Catálogo de modelos e preços da API hospedada
Este é um guia independente, sem afiliação ou endosso da DeepSeek. Nomes, modelos e marcas pertencem aos respectivos titulares.