DeepSeek para PC: como instalar e usar no LM Studio

Resposta direta: para rodar DeepSeek no LM Studio, instale o aplicativo, escolha um checkpoint de tamanho compatível com sua memória, baixe uma conversão GGUF ou MLX rastreável até o modelo oficial, carregue-o com contexto moderado e teste a resposta antes de aumentar o consumo de recursos. Para a maioria dos computadores com 16 GB de RAM, um DeepSeek-R1 destilado de 7B ou 8B em 4 bits é um ponto de partida mais realista do que o R1 completo, o V3 ou o V4.

Este guia usa configurações iniciais, não uma promessa de “melhor configuração” universal. O desempenho muda conforme CPU, GPU, memória, sistema operacional, runtime, quantização, contexto e versão do arquivo. Não executamos um benchmark próprio de hardware nesta página; use o estimador do LM Studio no seu computador antes de carregar o modelo.

DeepSeek para PC: usar no navegador ou rodar localmente?

Há dois caminhos diferentes. Para conversar com o produto oficial sem baixar pesos, use o DeepSeek Chat no navegador. Para processar as respostas no próprio computador, instale um runtime local, baixe um modelo compatível e assuma os requisitos de memória, armazenamento, segurança e manutenção. Esta página trata somente do segundo caminho.

O LM Studio não é um produto da DeepSeek. Um pacote exibido no catálogo pode usar um checkpoint publicado pela organização deepseek-ai e, ao mesmo tempo, conter uma conversão criada pela comunidade. Confirme separadamente o checkpoint de origem, o responsável pela conversão, a licença, a quantização e o tamanho do arquivo.

Segundo os requisitos oficiais consultados em 5 de agosto de 2026, o LM Studio oferece suporte a Windows x64 e Windows ARM. Em x64, a CPU precisa oferecer AVX2; a documentação recomenda pelo menos 16 GB de RAM e 4 GB de VRAM dedicada. Esses números são recomendações do aplicativo, não garantia de que qualquer modelo DeepSeek caberá ou terá velocidade adequada.

Depois que o aplicativo, o runtime e o modelo estão disponíveis na máquina, as funções principais de chat e servidor local podem operar sem internet. A pesquisa, o download de modelos, o download de runtimes e as atualizações continuam exigindo conexão. Para o aplicativo oficial móvel, consulte DeepSeek App; para separar chat, API e execução própria, veja o que é gratuito e o que é pago.

Antes de começar: local não é API oficial

  • deepseek-v4-flash e deepseek-v4-pro são IDs da API hospedada oficial na data de verificação.
  • Um arquivo local usa o identificador atribuído pelo LM Studio, não o ID da API da DeepSeek.
  • A DeepSeek publica pesos do V4, portanto V4 não é “somente API”. Contudo, Flash tem 284B parâmetros totais e Pro tem 1,6T; isso os torna escolhas pouco realistas para a maioria dos desktops.
  • Os arquivos GGUF exibidos no catálogo do LM Studio são frequentemente conversões da comunidade. Verifique a origem; não os descreva como arquivos GGUF oficiais da DeepSeek.

DeepSeek Português é um site independente, sem afiliação com a DeepSeek ou com o LM Studio. Não forneça senhas ou chaves da API oficial a um arquivo, aplicativo ou página que não precise delas.

Requisitos do LM Studio

Os requisitos do aplicativo e os requisitos do modelo são coisas diferentes. Um computador pode abrir o LM Studio e ainda não ter memória suficiente para o checkpoint escolhido.

SistemaRequisito documentado pelo LM StudioObservação prática
macOSApple Silicon M1, M2, M3 ou M4; macOS 14 ou posterior; 16 GB ou mais recomendados.Mac Intel não é suportado. Em Macs de 8 GB, limite-se a modelos menores e contexto modesto.
Windows x64CPU com AVX2; pelo menos 16 GB de RAM recomendados; GPU com 4 GB de VRAM recomendada.GPU dedicada ajuda, mas inferência por CPU ou offload parcial ainda pode funcionar com menor velocidade.
Windows ARMSuporte para máquinas ARM compatíveis, como Snapdragon X Elite.Confirme runtime e formato disponíveis para o modelo antes do download.
Linuxx64 ou ARM64; AppImage; Ubuntu 20.04 ou posterior. A versão x64 usa AVX2.O suporte do runtime e do driver de GPU continua sendo decisivo.

Reserve também espaço em disco para o arquivo do modelo e para futuras quantizações. Um modelo que ocupa 5 GB no disco precisa de memória adicional para contexto, cache, buffers do runtime e o próprio sistema operacional.

Qual modelo DeepSeek escolher?

Para uso em um computador pessoal, os checkpoints destilados da família DeepSeek R1 são mais acessíveis. Eles não são o modelo R1 completo: foram treinados sobre bases menores Qwen ou Llama com dados de raciocínio produzidos pelo R1.

ModeloPerfilTamanho do pacote destacado no catálogoEscolha prática
DeepSeek-R1-0528-Qwen3-8BDestilado de 8B baseado em Qwen3; há pacotes GGUF e MLX no catálogo do LM Studio.4,30 GBPrimeiro teste razoável em uma máquina com 16 GB de memória total.
DeepSeek-R1-Distill-Qwen-7BDestilado menor da primeira versão R1.4,30 GBAlternativa leve quando velocidade e economia de memória importam.
DeepSeek-R1-Distill-Qwen-14BMais parâmetros do que 7B/8B, com maior custo de memória.8,40 GBConsidere 24 GB de memória total para trabalhar com mais folga.
DeepSeek-R1-Distill-Qwen-32BModelo denso de 32B.18,70 GB32 GB ou mais de memória total é um ponto de planejamento mais conservador.
DeepSeek-R1-Distill-Llama-70BDestilado de 70B baseado em Llama.40,30 GBNormalmente exige uma máquina de alta memória; estime o arquivo exato antes de baixar.
DeepSeek-R1 completo671B totais e 37B ativados por token.Não incluído nesta comparação do catálogoNão confunda “37B ativados” com um arquivo de 37B; todos os pesos precisam ser armazenados.

Os valores do catálogo acima são tamanhos dos pacotes destacados para download, não requisitos mínimos de RAM nem garantia de experiência confortável. O próprio LM Studio recomenda 16 GB de RAM como requisito geral para macOS e Windows. Contexto maior, GPU offload, quantização e outros aplicativos aumentam ou redistribuem a memória necessária durante a execução.

E o DeepSeek V4 no LM Studio?

A DeepSeek publicou pesos MIT do V4 Flash e V4 Pro. Isso deve ser separado dos IDs hospedados deepseek-v4-flash e deepseek-v4-pro. O nome de uma API não baixa o checkpoint correspondente no LM Studio.

O V4 Flash possui 284B parâmetros totais e o Pro 1,6T. Além do tamanho, a distribuição oficial usa uma pasta de codificação própria em vez de um chat template Jinja. Quantizações de terceiros podem aparecer, mas compatibilidade, template, memória e fidelidade precisam ser verificados para cada pacote. Por isso, esta página não apresenta V4 como escolha inicial para desktop nem fornece uma configuração universal para ele.

Modelo local, arquivo GGUF e API: qual é a diferença?

ItemExemploQuem executaComo é identificado
Checkpoint oficialdeepseek-ai/DeepSeek-R1-0528-Qwen3-8BSua infraestrutura ou um provedor escolhido por vocêNome do repositório de pesos
Conversão para LM StudioPacote GGUF ou MLX criado a partir do checkpointLM Studio no computador localModel key ou identificador local
API local do LM Studiohttp://127.0.0.1:1234/v1Seu computadorID retornado por /v1/models ou definido ao carregar
API hospedada da DeepSeekhttps://api.deepseek.comInfraestrutura da DeepSeekdeepseek-v4-flash ou deepseek-v4-pro

Se você precisa da API hospedada, cobrança por token e modelos V4 gerenciados, consulte o guia da DeepSeek API. Se quer que a inferência ocorra no próprio equipamento, continue com o modelo local.

Como verificar a origem de um GGUF

GGUF é um formato de arquivo; ele não prova autoria, licença ou qualidade. Na verificação desta página, a entrada do catálogo para DeepSeek-R1-0528-Qwen3-8B aponta para arquivos GGUF e MLX mantidos por lmstudio-community. O checkpoint de origem está na organização oficial deepseek-ai. Essa distinção deve permanecer visível.

  1. Abra a ficha do modelo no Discover e leia a seção Sources.
  2. Confirme o nome do checkpoint de origem e compare-o com a organização oficial deepseek-ai.
  3. Identifique quem criou a conversão GGUF ou MLX; não atribua a conversão à DeepSeek se o repositório for comunitário.
  4. Leia o model card, a licença, a data da revisão, a quantização e o tamanho de todas as partes do arquivo.
  5. Se o repositório exibir o SHA-256 do arquivo, compare-o após o download. Não use um hash copiado de outra quantização ou revisão.
  6. Evite arquivos enviados por links encurtados, drives pessoais ou páginas que não mostrem origem e licença.

Nos modelos R1 destilados, verifique também a base. As variantes Qwen e Llama têm origens e termos de base diferentes. A licença do repositório DeepSeek não deve ser usada para ignorar avisos específicos do checkpoint ou da base.

Como instalar DeepSeek no LM Studio

1. Instale o LM Studio pela fonte oficial

Baixe a versão compatível com seu sistema pelo site do LM Studio. No Windows x64, confirme AVX2; no Mac, confirme Apple Silicon e macOS 14 ou posterior. Abra o aplicativo e permita que ele instale o runtime necessário ao formato escolhido.

2. Procure o modelo pelo nome exato

Na aba Discover, pesquise DeepSeek-R1-0528-Qwen3-8B para o ponto de partida de 8B. Também é possível colar um URL completo do Hugging Face. Leia a ficha e confirme o caminho do pacote antes de clicar em download.

Quem prefere a CLI pode iniciar uma busca filtrada para GGUF. O comando mostra opções; revise o repositório e a quantização antes de confirmar:

lms get deepseek-r1 --gguf --always-show-download-options

3. Escolha a quantização

O LM Studio orienta escolher uma opção de 4 bits ou superior quando a máquina comportar. Para um primeiro teste, Q4_K_M costuma oferecer tamanho manejável sem comprimir tanto quanto variantes de 3 bits. Q5 ou Q6 exigem mais memória e podem preservar mais fidelidade. Não presuma que o mesmo rótulo terá tamanho idêntico em modelos diferentes.

4. Liste o model key e estime a memória

lms ls
lms load --estimate-only <MODEL_KEY> --context-length 8192

O modo --estimate-only não carrega o modelo. Ele calcula uma estimativa considerando contexto, Flash Attention e GPU. Se a estimativa ficar próxima de toda a memória disponível, escolha um arquivo menor ou reduza o contexto antes de prosseguir.

5. Carregue com um identificador simples

lms load <MODEL_KEY> --context-length 8192 --identifier deepseek-local

Sem o parâmetro --gpu, o LM Studio tenta determinar o offload adequado. Se precisar testar manualmente, a CLI aceita uma fração entre 0 e 1, max ou off. Faça nova estimativa antes de usar offload máximo.

6. Teste no chat

Abra a aba de chat, selecione o modelo e envie um prompt verificável, por exemplo: “Responda em português do Brasil. Calcule 17 × 24 e mostre apenas a conta e o resultado.” Depois teste uma tarefa representativa do seu uso. Uma resposta fluente não comprova precisão; confira números, referências e código.

Configurações iniciais para DeepSeek R1

ConfiguraçãoPonto de partidaQuando ajustar
Temperature0,6A DeepSeek usa 0,6 nas recomendações do R1 e no ambiente do R1-0528. Mude somente após medir repetição, coerência e precisão.
Top P0,95 para R1É a configuração usada nas avaliações oficiais do R1. Não transfira automaticamente para outra família.
Context length4.096 ou 8.192Aumente apenas quando o prompt, os documentos e a resposta realmente exigirem mais.
Max tokens1.024 a 2.048Aumente se uma resposta válida for truncada; raciocínio longo consome contexto e memória.
GPU offloadAutomáticoUse estimativa e ajuste se houver falta de memória ou baixa utilização da GPU.
Prompt templateO fornecido pelo pacoteNão substitua por um template de outro checkpoint.
System prompt no R1-0528SuportadoNão é necessário forçar a saída a começar com <think> no R1-0528.

O contexto máximo declarado para um checkpoint não é a configuração que deve ser usada por padrão. A janela de 128K dos modelos R1 destilados pode exigir memória muito maior para o cache e reduzir a velocidade. Comece pequeno, teste recuperação de informação e aumente em etapas.

Também não use essas configurações do R1 como receita para V4. A própria página oficial do V4 recomenda temperature = 1.0 e top_p = 1.0 para implantação local. Cada família precisa do seu template e dos seus parâmetros documentados.

Orientação realista de memória

As faixas abaixo são margens de planejamento para quantizações próximas de 4 bits, não medições deste site nem requisitos garantidos. O arquivo exato, o contexto e o runtime prevalecem sobre a tabela.

Tamanho do modeloMemória total para planejarExpectativa
7B ou 8B, 4-bit16 GBFaixa mais acessível para chat local e testes com contexto moderado.
14B, 4-bit24 GB ou maisMais margem para o sistema, cache e contexto do que o mínimo do catálogo.
32B, 4-bit32 GB ou maisPode exigir offload parcial ou GPU com bastante VRAM para boa velocidade.
70B, 4-bit64 GB ou maisNormalmente voltado a workstations de alta memória; confirme todas as partes do arquivo.

Em Apple Silicon, RAM e VRAM usam memória unificada. Em uma GPU dedicada, caber todo o arquivo na VRAM pode melhorar a velocidade, mas não é obrigatório: LM Studio permite offload parcial. Em CPU, o modelo pode responder mesmo sem uma GPU forte, porém a velocidade pode ser muito menor.

Como iniciar o servidor local

Na aba Developer, ative Start server. Pela CLI, use:

lms server start --port 1234
lms server status

Por padrão, o servidor usa 127.0.0.1, acessível somente na própria máquina. Confira o modelo visível:

curl http://127.0.0.1:1234/v1/models

Se você carregou o modelo com --identifier deepseek-local, teste Chat Completions:

curl http://127.0.0.1:1234/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-local",
    "messages": [
      {
        "role": "user",
        "content": "Responda em português do Brasil: explique em três frases o que é inferência local."
      }
    ],
    "temperature": 0.6,
    "top_p": 0.95,
    "max_tokens": 512
  }'

O endpoint é compatível com o formato de Chat Completions, mas isso não transforma o modelo local no serviço da OpenAI ou da DeepSeek. Recursos dependem do modelo, do template e do runtime. Se a autenticação estiver ativada, inclua também o cabeçalho Authorization: Bearer SEU_TOKEN e mantenha o token fora do histórico do terminal e do código-fonte.

Exemplo com Node.js

Instale o cliente e salve o exemplo seguinte como um arquivo .mjs — ou configure seu projeto Node.js para usar módulos ES:

npm install openai
import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "http://127.0.0.1:1234/v1",
  apiKey: process.env.LM_STUDIO_API_TOKEN || "lm-studio",
});

const response = await client.chat.completions.create({
  model: process.env.LM_STUDIO_MODEL || "deepseek-local",
  messages: [
    {
      role: "user",
      content: "Responda em português do Brasil: crie uma checklist com três itens para testar um modelo local.",
    },
  ],
  temperature: 0.6,
  top_p: 0.95,
  max_tokens: 512,
});

console.log(response.choices[0]?.message?.content ?? "Sem resposta");

Quando a autenticação estiver desativada, o SDK ainda exige um valor não vazio e lm-studio funciona como marcador local. Se você ativar autenticação no LM Studio, defina LM_STUDIO_API_TOKEN com o token real e não o inclua no código-fonte.

Privacidade e segurança

Segundo a documentação do LM Studio, chat com modelos baixados, processamento local de documentos e servidor local podem funcionar offline; o conteúdo inserido nessas funções principais permanece no dispositivo. Pesquisa e download de modelos, download de runtimes e atualizações exigem conexão.

Essa arquitetura reduz o envio de prompts a uma API externa, mas não torna o computador automaticamente seguro ou compatível com uma lei. Histórico local, arquivos, backups e memória do sistema continuam sujeitos a acesso físico, malware e permissões do usuário. Integrações remotas, MCP, ferramentas web ou aplicativos que chamam outros serviços podem transmitir dados para fora da máquina.

  • Mantenha o servidor em 127.0.0.1 para uso individual.
  • Não use --bind 0.0.0.0 sem necessidade, autenticação e firewall.
  • O servidor não exige autenticação por padrão. Em LM Studio 0.4.0 ou posterior, ative API Tokens em Developer → Server Settings quando houver acesso por rede.
  • Deixe CORS desativado se uma aplicação web não precisar dele. A documentação do LM Studio alerta que habilitá-lo aumenta o risco.
  • Use criptografia de disco, conta de sistema protegida e permissões mínimas para diretórios de modelos e chats.
  • Revise cada MCP ou ferramenta antes de conceder acesso a arquivos, terminal, navegador ou rede.
  • Não envie dados sensíveis apenas porque a interface diz “local”; confirme todo o fluxo e os serviços conectados.

Erros comuns e como resolver

ProblemaCausa provávelCorreção
O modelo não aparece na buscaInternet indisponível, termo impreciso ou runtime não instalado.Confirme a conexão, pesquise o nome completo ou cole o URL do repositório e instale o runtime suportado.
Out of Memory ao carregarArquivo grande, contexto alto ou offload excessivo.Execute --estimate-only, reduza o contexto, escolha Q4 ou modelo menor e deixe o offload automático.
O computador congela ou usa swapEstimativa muito próxima da memória total.Feche aplicativos, deixe margem para o sistema e use um checkpoint menor.
Respostas muito lentasModelo grande na CPU, pouco offload ou contexto excessivo.Teste 7B/8B, contexto de 4K/8K e ajuste de GPU somente após estimar.
Texto incoerente ou caracteres estranhosTemplate incorreto, runtime incompatível ou conversão defeituosa.Recarregue um pacote do catálogo com origem clara, atualize o runtime e não substitua o template.
R1 repete indefinidamenteSampling ou template inadequado.Teste temperature 0,6 e top_p 0,95, abra uma conversa nova e confirme o template do checkpoint.
model not foundO ID usado no código não corresponde ao servidor.Consulte /v1/models ou carregue com --identifier deepseek-local.
HTTP 401Autenticação ativada sem token válido.Crie um API Token, copie-o uma vez e envie Authorization: Bearer ....
O navegador bloqueia por CORSCORS está desativado por padrão.Prefira um backend local. Se CORS for indispensável, habilite-o com autenticação e coloque um backend ou proxy com restrição explícita de origem à frente do servidor.
A busca não funciona offlineDiscover precisa consultar serviços externos.Baixe modelos e runtimes antes de desconectar; inferência local pode continuar offline.

Como avaliar se a configuração ficou boa

  1. Escolha de 10 a 30 tarefas reais com resposta ou critério verificável.
  2. Registre modelo, repositório, revisão, quantização, contexto, runtime e hardware.
  3. Meça tempo até o primeiro token, tokens por segundo, memória máxima e erros de carregamento.
  4. Avalie acerto, obediência ao formato, qualidade em PT-BR e taxa de respostas inventadas.
  5. Mude apenas uma variável por vez: quantização, contexto, temperature ou offload.
  6. Escolha o menor modelo que atinge o nível necessário com velocidade aceitável.

Esse procedimento produz uma configuração defensável para a sua máquina. Copiar um número de outro computador sem o mesmo arquivo, contexto e runtime não produz uma comparação válida.

Perguntas frequentes

LM Studio é um produto oficial da DeepSeek?

Não. LM Studio é uma ferramenta separada para executar modelos locais. Uma entrada do catálogo pode apontar para pesos da DeepSeek e para uma conversão comunitária, sem tornar o aplicativo um canal oficial da DeepSeek.

Qual modelo é mais fácil para começar?

DeepSeek-R1-0528-Qwen3-8B em uma quantização de 4 bits é um ponto de partida razoável para uma máquina com 16 GB de memória. Verifique a conversão exata e use o estimador antes de carregar.

O modelo local é igual ao DeepSeek Chat?

Não. O chat oficial inclui modelo hospedado, interface, prompts de sistema, ferramentas, limites e políticas próprios. Um destilado GGUF de 8B é outro modelo e pode responder de maneira diferente.

Posso digitar deepseek-v4-flash no LM Studio?

Esse nome é um ID da API hospedada. O LM Studio precisa de um arquivo ou pacote local compatível e usa seu próprio identificador. Embora a DeepSeek publique pesos do V4, o tamanho e a codificação tornam a implantação uma tarefa avançada.

DeepSeek no LM Studio funciona offline?

Depois que aplicativo, runtime e modelo estão instalados, chat, documentos e servidor local podem funcionar offline. Pesquisa, download e atualização precisam de conexão.

Os prompts ficam privados?

As funções principais de inferência local permanecem no dispositivo segundo o LM Studio. Porém, ferramentas remotas, MCP, backups, histórico local e outros aplicativos mudam o fluxo. Verifique toda a configuração antes de usar dados sensíveis.

Preciso de uma GPU?

Não obrigatoriamente. É possível executar alguns modelos por CPU, mas uma GPU compatível ou memória unificada pode melhorar muito a velocidade. O modelo ainda precisa caber na combinação de RAM, VRAM e cache disponível.

Q4_K_M é sempre a melhor quantização?

Não. É apenas um ponto de partida comum. Q5/Q6 podem preservar mais fidelidade com maior memória; Q3 pode caber em máquinas menores com perda potencial de qualidade. Teste no seu conjunto de tarefas.

Posso usar o modelo em um produto comercial?

Os repositórios oficiais R1 e R1-0528 declaram licença MIT e permitem uso comercial, mas variantes destiladas têm bases Qwen ou Llama e o pacote comunitário pode trazer avisos adicionais. Leia a licença do checkpoint, da base e da conversão; esta página não é aconselhamento jurídico.

Conclusão

Rodar DeepSeek no LM Studio é mais seguro e previsível quando você separa quatro elementos: checkpoint oficial, conversão comunitária, identificador local e API hospedada. Para começar, escolha um R1 destilado de 7B ou 8B, confirme a origem do pacote, use 4-bit ou superior se houver memória, estime os recursos e carregue com contexto moderado.

Mantenha o servidor em localhost, habilite autenticação antes de qualquer acesso por rede e trate integrações como novos fluxos de dados. Depois, meça qualidade e velocidade com tarefas reais antes de subir para 14B, 32B ou contextos maiores.

Fontes oficiais consultadas