Resposta direta: para rodar DeepSeek no LM Studio, instale o aplicativo, escolha um checkpoint de tamanho compatível com sua memória, baixe uma conversão GGUF ou MLX rastreável até o modelo oficial, carregue-o com contexto moderado e teste a resposta antes de aumentar o consumo de recursos. Para a maioria dos computadores com 16 GB de RAM, um DeepSeek-R1 destilado de 7B ou 8B em 4 bits é um ponto de partida mais realista do que o R1 completo, o V3 ou o V4.
Este guia usa configurações iniciais, não uma promessa de “melhor configuração” universal. O desempenho muda conforme CPU, GPU, memória, sistema operacional, runtime, quantização, contexto e versão do arquivo. Não executamos um benchmark próprio de hardware nesta página; use o estimador do LM Studio no seu computador antes de carregar o modelo.
DeepSeek para PC: usar no navegador ou rodar localmente?
Há dois caminhos diferentes. Para conversar com o produto oficial sem baixar pesos, use o DeepSeek Chat no navegador. Para processar as respostas no próprio computador, instale um runtime local, baixe um modelo compatível e assuma os requisitos de memória, armazenamento, segurança e manutenção. Esta página trata somente do segundo caminho.
O LM Studio não é um produto da DeepSeek. Um pacote exibido no catálogo pode usar um checkpoint publicado pela organização deepseek-ai e, ao mesmo tempo, conter uma conversão criada pela comunidade. Confirme separadamente o checkpoint de origem, o responsável pela conversão, a licença, a quantização e o tamanho do arquivo.
Segundo os requisitos oficiais consultados em 5 de agosto de 2026, o LM Studio oferece suporte a Windows x64 e Windows ARM. Em x64, a CPU precisa oferecer AVX2; a documentação recomenda pelo menos 16 GB de RAM e 4 GB de VRAM dedicada. Esses números são recomendações do aplicativo, não garantia de que qualquer modelo DeepSeek caberá ou terá velocidade adequada.
Depois que o aplicativo, o runtime e o modelo estão disponíveis na máquina, as funções principais de chat e servidor local podem operar sem internet. A pesquisa, o download de modelos, o download de runtimes e as atualizações continuam exigindo conexão. Para o aplicativo oficial móvel, consulte DeepSeek App; para separar chat, API e execução própria, veja o que é gratuito e o que é pago.
Antes de começar: local não é API oficial
deepseek-v4-flashedeepseek-v4-prosão IDs da API hospedada oficial na data de verificação.- Um arquivo local usa o identificador atribuído pelo LM Studio, não o ID da API da DeepSeek.
- A DeepSeek publica pesos do V4, portanto V4 não é “somente API”. Contudo, Flash tem 284B parâmetros totais e Pro tem 1,6T; isso os torna escolhas pouco realistas para a maioria dos desktops.
- Os arquivos GGUF exibidos no catálogo do LM Studio são frequentemente conversões da comunidade. Verifique a origem; não os descreva como arquivos GGUF oficiais da DeepSeek.
DeepSeek Português é um site independente, sem afiliação com a DeepSeek ou com o LM Studio. Não forneça senhas ou chaves da API oficial a um arquivo, aplicativo ou página que não precise delas.
Requisitos do LM Studio
Os requisitos do aplicativo e os requisitos do modelo são coisas diferentes. Um computador pode abrir o LM Studio e ainda não ter memória suficiente para o checkpoint escolhido.
| Sistema | Requisito documentado pelo LM Studio | Observação prática |
|---|---|---|
| macOS | Apple Silicon M1, M2, M3 ou M4; macOS 14 ou posterior; 16 GB ou mais recomendados. | Mac Intel não é suportado. Em Macs de 8 GB, limite-se a modelos menores e contexto modesto. |
| Windows x64 | CPU com AVX2; pelo menos 16 GB de RAM recomendados; GPU com 4 GB de VRAM recomendada. | GPU dedicada ajuda, mas inferência por CPU ou offload parcial ainda pode funcionar com menor velocidade. |
| Windows ARM | Suporte para máquinas ARM compatíveis, como Snapdragon X Elite. | Confirme runtime e formato disponíveis para o modelo antes do download. |
| Linux | x64 ou ARM64; AppImage; Ubuntu 20.04 ou posterior. A versão x64 usa AVX2. | O suporte do runtime e do driver de GPU continua sendo decisivo. |
Reserve também espaço em disco para o arquivo do modelo e para futuras quantizações. Um modelo que ocupa 5 GB no disco precisa de memória adicional para contexto, cache, buffers do runtime e o próprio sistema operacional.
Qual modelo DeepSeek escolher?
Para uso em um computador pessoal, os checkpoints destilados da família DeepSeek R1 são mais acessíveis. Eles não são o modelo R1 completo: foram treinados sobre bases menores Qwen ou Llama com dados de raciocínio produzidos pelo R1.
| Modelo | Perfil | Tamanho do pacote destacado no catálogo | Escolha prática |
|---|---|---|---|
| DeepSeek-R1-0528-Qwen3-8B | Destilado de 8B baseado em Qwen3; há pacotes GGUF e MLX no catálogo do LM Studio. | 4,30 GB | Primeiro teste razoável em uma máquina com 16 GB de memória total. |
| DeepSeek-R1-Distill-Qwen-7B | Destilado menor da primeira versão R1. | 4,30 GB | Alternativa leve quando velocidade e economia de memória importam. |
| DeepSeek-R1-Distill-Qwen-14B | Mais parâmetros do que 7B/8B, com maior custo de memória. | 8,40 GB | Considere 24 GB de memória total para trabalhar com mais folga. |
| DeepSeek-R1-Distill-Qwen-32B | Modelo denso de 32B. | 18,70 GB | 32 GB ou mais de memória total é um ponto de planejamento mais conservador. |
| DeepSeek-R1-Distill-Llama-70B | Destilado de 70B baseado em Llama. | 40,30 GB | Normalmente exige uma máquina de alta memória; estime o arquivo exato antes de baixar. |
| DeepSeek-R1 completo | 671B totais e 37B ativados por token. | Não incluído nesta comparação do catálogo | Não confunda “37B ativados” com um arquivo de 37B; todos os pesos precisam ser armazenados. |
Os valores do catálogo acima são tamanhos dos pacotes destacados para download, não requisitos mínimos de RAM nem garantia de experiência confortável. O próprio LM Studio recomenda 16 GB de RAM como requisito geral para macOS e Windows. Contexto maior, GPU offload, quantização e outros aplicativos aumentam ou redistribuem a memória necessária durante a execução.
E o DeepSeek V4 no LM Studio?
A DeepSeek publicou pesos MIT do V4 Flash e V4 Pro. Isso deve ser separado dos IDs hospedados deepseek-v4-flash e deepseek-v4-pro. O nome de uma API não baixa o checkpoint correspondente no LM Studio.
O V4 Flash possui 284B parâmetros totais e o Pro 1,6T. Além do tamanho, a distribuição oficial usa uma pasta de codificação própria em vez de um chat template Jinja. Quantizações de terceiros podem aparecer, mas compatibilidade, template, memória e fidelidade precisam ser verificados para cada pacote. Por isso, esta página não apresenta V4 como escolha inicial para desktop nem fornece uma configuração universal para ele.
Modelo local, arquivo GGUF e API: qual é a diferença?
| Item | Exemplo | Quem executa | Como é identificado |
|---|---|---|---|
| Checkpoint oficial | deepseek-ai/DeepSeek-R1-0528-Qwen3-8B | Sua infraestrutura ou um provedor escolhido por você | Nome do repositório de pesos |
| Conversão para LM Studio | Pacote GGUF ou MLX criado a partir do checkpoint | LM Studio no computador local | Model key ou identificador local |
| API local do LM Studio | http://127.0.0.1:1234/v1 | Seu computador | ID retornado por /v1/models ou definido ao carregar |
| API hospedada da DeepSeek | https://api.deepseek.com | Infraestrutura da DeepSeek | deepseek-v4-flash ou deepseek-v4-pro |
Se você precisa da API hospedada, cobrança por token e modelos V4 gerenciados, consulte o guia da DeepSeek API. Se quer que a inferência ocorra no próprio equipamento, continue com o modelo local.
Como verificar a origem de um GGUF
GGUF é um formato de arquivo; ele não prova autoria, licença ou qualidade. Na verificação desta página, a entrada do catálogo para DeepSeek-R1-0528-Qwen3-8B aponta para arquivos GGUF e MLX mantidos por lmstudio-community. O checkpoint de origem está na organização oficial deepseek-ai. Essa distinção deve permanecer visível.
- Abra a ficha do modelo no Discover e leia a seção Sources.
- Confirme o nome do checkpoint de origem e compare-o com a organização oficial
deepseek-ai. - Identifique quem criou a conversão GGUF ou MLX; não atribua a conversão à DeepSeek se o repositório for comunitário.
- Leia o model card, a licença, a data da revisão, a quantização e o tamanho de todas as partes do arquivo.
- Se o repositório exibir o SHA-256 do arquivo, compare-o após o download. Não use um hash copiado de outra quantização ou revisão.
- Evite arquivos enviados por links encurtados, drives pessoais ou páginas que não mostrem origem e licença.
Nos modelos R1 destilados, verifique também a base. As variantes Qwen e Llama têm origens e termos de base diferentes. A licença do repositório DeepSeek não deve ser usada para ignorar avisos específicos do checkpoint ou da base.
Como instalar DeepSeek no LM Studio
1. Instale o LM Studio pela fonte oficial
Baixe a versão compatível com seu sistema pelo site do LM Studio. No Windows x64, confirme AVX2; no Mac, confirme Apple Silicon e macOS 14 ou posterior. Abra o aplicativo e permita que ele instale o runtime necessário ao formato escolhido.
2. Procure o modelo pelo nome exato
Na aba Discover, pesquise DeepSeek-R1-0528-Qwen3-8B para o ponto de partida de 8B. Também é possível colar um URL completo do Hugging Face. Leia a ficha e confirme o caminho do pacote antes de clicar em download.
Quem prefere a CLI pode iniciar uma busca filtrada para GGUF. O comando mostra opções; revise o repositório e a quantização antes de confirmar:
lms get deepseek-r1 --gguf --always-show-download-options
3. Escolha a quantização
O LM Studio orienta escolher uma opção de 4 bits ou superior quando a máquina comportar. Para um primeiro teste, Q4_K_M costuma oferecer tamanho manejável sem comprimir tanto quanto variantes de 3 bits. Q5 ou Q6 exigem mais memória e podem preservar mais fidelidade. Não presuma que o mesmo rótulo terá tamanho idêntico em modelos diferentes.
4. Liste o model key e estime a memória
lms ls
lms load --estimate-only <MODEL_KEY> --context-length 8192
O modo --estimate-only não carrega o modelo. Ele calcula uma estimativa considerando contexto, Flash Attention e GPU. Se a estimativa ficar próxima de toda a memória disponível, escolha um arquivo menor ou reduza o contexto antes de prosseguir.
5. Carregue com um identificador simples
lms load <MODEL_KEY> --context-length 8192 --identifier deepseek-local
Sem o parâmetro --gpu, o LM Studio tenta determinar o offload adequado. Se precisar testar manualmente, a CLI aceita uma fração entre 0 e 1, max ou off. Faça nova estimativa antes de usar offload máximo.
6. Teste no chat
Abra a aba de chat, selecione o modelo e envie um prompt verificável, por exemplo: “Responda em português do Brasil. Calcule 17 × 24 e mostre apenas a conta e o resultado.” Depois teste uma tarefa representativa do seu uso. Uma resposta fluente não comprova precisão; confira números, referências e código.
Configurações iniciais para DeepSeek R1
| Configuração | Ponto de partida | Quando ajustar |
|---|---|---|
| Temperature | 0,6 | A DeepSeek usa 0,6 nas recomendações do R1 e no ambiente do R1-0528. Mude somente após medir repetição, coerência e precisão. |
| Top P | 0,95 para R1 | É a configuração usada nas avaliações oficiais do R1. Não transfira automaticamente para outra família. |
| Context length | 4.096 ou 8.192 | Aumente apenas quando o prompt, os documentos e a resposta realmente exigirem mais. |
| Max tokens | 1.024 a 2.048 | Aumente se uma resposta válida for truncada; raciocínio longo consome contexto e memória. |
| GPU offload | Automático | Use estimativa e ajuste se houver falta de memória ou baixa utilização da GPU. |
| Prompt template | O fornecido pelo pacote | Não substitua por um template de outro checkpoint. |
| System prompt no R1-0528 | Suportado | Não é necessário forçar a saída a começar com <think> no R1-0528. |
O contexto máximo declarado para um checkpoint não é a configuração que deve ser usada por padrão. A janela de 128K dos modelos R1 destilados pode exigir memória muito maior para o cache e reduzir a velocidade. Comece pequeno, teste recuperação de informação e aumente em etapas.
Também não use essas configurações do R1 como receita para V4. A própria página oficial do V4 recomenda temperature = 1.0 e top_p = 1.0 para implantação local. Cada família precisa do seu template e dos seus parâmetros documentados.
Orientação realista de memória
As faixas abaixo são margens de planejamento para quantizações próximas de 4 bits, não medições deste site nem requisitos garantidos. O arquivo exato, o contexto e o runtime prevalecem sobre a tabela.
| Tamanho do modelo | Memória total para planejar | Expectativa |
|---|---|---|
| 7B ou 8B, 4-bit | 16 GB | Faixa mais acessível para chat local e testes com contexto moderado. |
| 14B, 4-bit | 24 GB ou mais | Mais margem para o sistema, cache e contexto do que o mínimo do catálogo. |
| 32B, 4-bit | 32 GB ou mais | Pode exigir offload parcial ou GPU com bastante VRAM para boa velocidade. |
| 70B, 4-bit | 64 GB ou mais | Normalmente voltado a workstations de alta memória; confirme todas as partes do arquivo. |
Em Apple Silicon, RAM e VRAM usam memória unificada. Em uma GPU dedicada, caber todo o arquivo na VRAM pode melhorar a velocidade, mas não é obrigatório: LM Studio permite offload parcial. Em CPU, o modelo pode responder mesmo sem uma GPU forte, porém a velocidade pode ser muito menor.
Como iniciar o servidor local
Na aba Developer, ative Start server. Pela CLI, use:
lms server start --port 1234
lms server status
Por padrão, o servidor usa 127.0.0.1, acessível somente na própria máquina. Confira o modelo visível:
curl http://127.0.0.1:1234/v1/models
Se você carregou o modelo com --identifier deepseek-local, teste Chat Completions:
curl http://127.0.0.1:1234/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-local",
"messages": [
{
"role": "user",
"content": "Responda em português do Brasil: explique em três frases o que é inferência local."
}
],
"temperature": 0.6,
"top_p": 0.95,
"max_tokens": 512
}'
O endpoint é compatível com o formato de Chat Completions, mas isso não transforma o modelo local no serviço da OpenAI ou da DeepSeek. Recursos dependem do modelo, do template e do runtime. Se a autenticação estiver ativada, inclua também o cabeçalho Authorization: Bearer SEU_TOKEN e mantenha o token fora do histórico do terminal e do código-fonte.
Exemplo com Node.js
Instale o cliente e salve o exemplo seguinte como um arquivo .mjs — ou configure seu projeto Node.js para usar módulos ES:
npm install openai
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "http://127.0.0.1:1234/v1",
apiKey: process.env.LM_STUDIO_API_TOKEN || "lm-studio",
});
const response = await client.chat.completions.create({
model: process.env.LM_STUDIO_MODEL || "deepseek-local",
messages: [
{
role: "user",
content: "Responda em português do Brasil: crie uma checklist com três itens para testar um modelo local.",
},
],
temperature: 0.6,
top_p: 0.95,
max_tokens: 512,
});
console.log(response.choices[0]?.message?.content ?? "Sem resposta");
Quando a autenticação estiver desativada, o SDK ainda exige um valor não vazio e lm-studio funciona como marcador local. Se você ativar autenticação no LM Studio, defina LM_STUDIO_API_TOKEN com o token real e não o inclua no código-fonte.
Privacidade e segurança
Segundo a documentação do LM Studio, chat com modelos baixados, processamento local de documentos e servidor local podem funcionar offline; o conteúdo inserido nessas funções principais permanece no dispositivo. Pesquisa e download de modelos, download de runtimes e atualizações exigem conexão.
Essa arquitetura reduz o envio de prompts a uma API externa, mas não torna o computador automaticamente seguro ou compatível com uma lei. Histórico local, arquivos, backups e memória do sistema continuam sujeitos a acesso físico, malware e permissões do usuário. Integrações remotas, MCP, ferramentas web ou aplicativos que chamam outros serviços podem transmitir dados para fora da máquina.
- Mantenha o servidor em
127.0.0.1para uso individual. - Não use
--bind 0.0.0.0sem necessidade, autenticação e firewall. - O servidor não exige autenticação por padrão. Em LM Studio 0.4.0 ou posterior, ative API Tokens em Developer → Server Settings quando houver acesso por rede.
- Deixe CORS desativado se uma aplicação web não precisar dele. A documentação do LM Studio alerta que habilitá-lo aumenta o risco.
- Use criptografia de disco, conta de sistema protegida e permissões mínimas para diretórios de modelos e chats.
- Revise cada MCP ou ferramenta antes de conceder acesso a arquivos, terminal, navegador ou rede.
- Não envie dados sensíveis apenas porque a interface diz “local”; confirme todo o fluxo e os serviços conectados.
Erros comuns e como resolver
| Problema | Causa provável | Correção |
|---|---|---|
| O modelo não aparece na busca | Internet indisponível, termo impreciso ou runtime não instalado. | Confirme a conexão, pesquise o nome completo ou cole o URL do repositório e instale o runtime suportado. |
| Out of Memory ao carregar | Arquivo grande, contexto alto ou offload excessivo. | Execute --estimate-only, reduza o contexto, escolha Q4 ou modelo menor e deixe o offload automático. |
| O computador congela ou usa swap | Estimativa muito próxima da memória total. | Feche aplicativos, deixe margem para o sistema e use um checkpoint menor. |
| Respostas muito lentas | Modelo grande na CPU, pouco offload ou contexto excessivo. | Teste 7B/8B, contexto de 4K/8K e ajuste de GPU somente após estimar. |
| Texto incoerente ou caracteres estranhos | Template incorreto, runtime incompatível ou conversão defeituosa. | Recarregue um pacote do catálogo com origem clara, atualize o runtime e não substitua o template. |
| R1 repete indefinidamente | Sampling ou template inadequado. | Teste temperature 0,6 e top_p 0,95, abra uma conversa nova e confirme o template do checkpoint. |
model not found | O ID usado no código não corresponde ao servidor. | Consulte /v1/models ou carregue com --identifier deepseek-local. |
| HTTP 401 | Autenticação ativada sem token válido. | Crie um API Token, copie-o uma vez e envie Authorization: Bearer .... |
| O navegador bloqueia por CORS | CORS está desativado por padrão. | Prefira um backend local. Se CORS for indispensável, habilite-o com autenticação e coloque um backend ou proxy com restrição explícita de origem à frente do servidor. |
| A busca não funciona offline | Discover precisa consultar serviços externos. | Baixe modelos e runtimes antes de desconectar; inferência local pode continuar offline. |
Como avaliar se a configuração ficou boa
- Escolha de 10 a 30 tarefas reais com resposta ou critério verificável.
- Registre modelo, repositório, revisão, quantização, contexto, runtime e hardware.
- Meça tempo até o primeiro token, tokens por segundo, memória máxima e erros de carregamento.
- Avalie acerto, obediência ao formato, qualidade em PT-BR e taxa de respostas inventadas.
- Mude apenas uma variável por vez: quantização, contexto, temperature ou offload.
- Escolha o menor modelo que atinge o nível necessário com velocidade aceitável.
Esse procedimento produz uma configuração defensável para a sua máquina. Copiar um número de outro computador sem o mesmo arquivo, contexto e runtime não produz uma comparação válida.
Perguntas frequentes
LM Studio é um produto oficial da DeepSeek?
Não. LM Studio é uma ferramenta separada para executar modelos locais. Uma entrada do catálogo pode apontar para pesos da DeepSeek e para uma conversão comunitária, sem tornar o aplicativo um canal oficial da DeepSeek.
Qual modelo é mais fácil para começar?
DeepSeek-R1-0528-Qwen3-8B em uma quantização de 4 bits é um ponto de partida razoável para uma máquina com 16 GB de memória. Verifique a conversão exata e use o estimador antes de carregar.
O modelo local é igual ao DeepSeek Chat?
Não. O chat oficial inclui modelo hospedado, interface, prompts de sistema, ferramentas, limites e políticas próprios. Um destilado GGUF de 8B é outro modelo e pode responder de maneira diferente.
Posso digitar deepseek-v4-flash no LM Studio?
Esse nome é um ID da API hospedada. O LM Studio precisa de um arquivo ou pacote local compatível e usa seu próprio identificador. Embora a DeepSeek publique pesos do V4, o tamanho e a codificação tornam a implantação uma tarefa avançada.
DeepSeek no LM Studio funciona offline?
Depois que aplicativo, runtime e modelo estão instalados, chat, documentos e servidor local podem funcionar offline. Pesquisa, download e atualização precisam de conexão.
Os prompts ficam privados?
As funções principais de inferência local permanecem no dispositivo segundo o LM Studio. Porém, ferramentas remotas, MCP, backups, histórico local e outros aplicativos mudam o fluxo. Verifique toda a configuração antes de usar dados sensíveis.
Preciso de uma GPU?
Não obrigatoriamente. É possível executar alguns modelos por CPU, mas uma GPU compatível ou memória unificada pode melhorar muito a velocidade. O modelo ainda precisa caber na combinação de RAM, VRAM e cache disponível.
Q4_K_M é sempre a melhor quantização?
Não. É apenas um ponto de partida comum. Q5/Q6 podem preservar mais fidelidade com maior memória; Q3 pode caber em máquinas menores com perda potencial de qualidade. Teste no seu conjunto de tarefas.
Posso usar o modelo em um produto comercial?
Os repositórios oficiais R1 e R1-0528 declaram licença MIT e permitem uso comercial, mas variantes destiladas têm bases Qwen ou Llama e o pacote comunitário pode trazer avisos adicionais. Leia a licença do checkpoint, da base e da conversão; esta página não é aconselhamento jurídico.
Conclusão
Rodar DeepSeek no LM Studio é mais seguro e previsível quando você separa quatro elementos: checkpoint oficial, conversão comunitária, identificador local e API hospedada. Para começar, escolha um R1 destilado de 7B ou 8B, confirme a origem do pacote, use 4-bit ou superior se houver memória, estime os recursos e carregue com contexto moderado.
Mantenha o servidor em localhost, habilite autenticação antes de qualquer acesso por rede e trate integrações como novos fluxos de dados. Depois, meça qualidade e velocidade com tarefas reais antes de subir para 14B, 32B ou contextos maiores.
Fontes oficiais consultadas
- LM Studio: requisitos de sistema.
- LM Studio: pesquisar, baixar e escolher quantizações.
- Catálogo do LM Studio: DeepSeek-R1-0528-Qwen3-8B e fontes do pacote.
- LM Studio CLI: lms get.
- LM Studio CLI: carregar e estimar memória.
- LM Studio CLI: iniciar, vincular e proteger o servidor.
- LM Studio: autenticação com API Tokens.
- LM Studio: endpoint Chat Completions.
- LM Studio: endpoint para listar modelos.
- LM Studio: operação offline e privacidade local.
- DeepSeek: cartão oficial, variantes e licença do R1.
- DeepSeek: checkpoint oficial R1-0528-Qwen3-8B.
- DeepSeek: pesos, tamanho, codificação e licença do V4.
- DeepSeek API: IDs hospedados documentados.
