DeepSeek VL: arquitetura, variantes e uso em visão e linguagem

DeepSeek VL é uma família de modelos de visão e linguagem publicada pela DeepSeek em 2024. Ela combina imagens e texto para tarefas como descrição visual, perguntas sobre imagens, OCR e compreensão de documentos. Esta página explica a família original, suas variantes, a arquitetura documentada, a relação com o DeepSeek-VL2 e os cuidados necessários para testes locais.

Status verificado em 23 de agosto de 2026. DeepSeek-VL e DeepSeek-VL2 continuam sendo famílias de pesos publicadas para pesquisa e execução própria; nenhuma delas é um ID hospedado atual. Desde 21/08/2026, a API oficial aceita imagens por meio de um modelo diferente e experimental: deepseek-v4-flash-vision-exp. Não há base oficial para chamar o Vision Exp de “DeepSeek-VL3”, de alias do VL/VL2 ou de checkpoint equivalente.

O DeepSeek Português é um guia independente, operado por terceiros e sem afiliação, patrocínio ou endosso da DeepSeek. Para disponibilidade, licenças e requisitos técnicos, confirme sempre o repositório ou a documentação oficial citada nesta página.

Resumo do DeepSeek VL

AspectoInformação verificada
NaturezaFamília de modelos de visão e linguagem com pesos publicados
Lançamento da família original11 de março de 2024
Variantes originais1.3B-base, 1.3B-chat, 7B-base e 7B-chat
Comprimento de sequência documentado4.096 tokens nas quatro variantes
EntradasImagem e texto no runtime da família DeepSeek-VL
TarefasVQA, descrição de imagens, OCR, páginas web, documentos, tabelas, gráficos e fórmulas
API hospedada atualDeepSeek-VL e VL2 não aparecem como model IDs hospedados
LicençasCódigo sob MIT; modelos Base/Chat sujeitos à DeepSeek Model License

Não confunda três superfícies diferentes

SuperfícieO que éComo acessarO que não afirmar
DeepSeek-VLFamília original de pesos de 2024Repositório/model card e runtime próprioNão é ID da API atual
DeepSeek-VL2Sucessor técnico com arquitetura MoERepositório/model card e runtime próprioNão é endpoint hospedado atual
V4 Flash Vision ExpModelo multimodal hospedado experimental de 2026deepseek-v4-flash-vision-expNão afirmar que usa pesos VL/VL2 ou que tem pesos publicados sem fonte

As tarefas podem se sobrepor — descrição de imagens, leitura de screenshots, gráficos e OCR assistido —, mas isso não torna os modelos tecnicamente iguais. Compare a versão exata, a licença, a superfície de acesso e o protocolo utilizado.

O que é DeepSeek VL?

Um vision-language model, ou VLM, recebe informação visual e textual na mesma tarefa. Em vez de analisar apenas palavras, o sistema transforma a imagem em representações que o componente de linguagem consegue usar para responder a uma pergunta, descrever elementos ou relacionar texto e imagem.

O repositório oficial do DeepSeek-VL descreve aplicações em diagramas lógicos, páginas web, reconhecimento de fórmulas, literatura científica, imagens naturais e cenários visuais complexos. A família foi disponibilizada em tamanhos de 1,3 bilhão e 7 bilhões de parâmetros, cada um com uma variante base e outra preparada para conversação.

Esse escopo não transforma o modelo em um serviço pronto. Os pesos, o código de inferência e o aplicativo oficial da DeepSeek são superfícies diferentes. Quem executa DeepSeek-VL precisa escolher infraestrutura, proteger os arquivos processados, validar a saída e cumprir as licenças aplicáveis.

Como a arquitetura funciona

A arquitetura documentada pode ser entendida como três partes: um codificador visual, um adaptador que aproxima a representação da imagem do espaço linguístico e um modelo de linguagem que produz a resposta. O treinamento multimodal conecta essas partes para que a geração considere o conteúdo visual e a instrução textual.

Codificador visual híbrido

Na variante 7B, a documentação descreve um codificador híbrido que combina SigLIP-L e SAM-B e trabalha com imagens de até 1.024 × 1.024 pixels. A proposta é preservar informação semântica e detalhes locais, algo importante para caracteres pequenos, elementos de interface, rótulos de gráficos e layouts densos.

Adaptador de visão

O adaptador converte as representações produzidas pelo codificador visual para um formato que o modelo de linguagem possa consumir. Ele é a ponte entre o que foi detectado na imagem e a sequência textual usada na geração.

Componente de linguagem

O componente de linguagem interpreta a instrução, relaciona-a com os sinais visuais e gera a resposta. A resposta pode parecer convincente mesmo quando a leitura visual está errada; por isso, a arquitetura não elimina a necessidade de validação.

Variantes publicadas

VarianteTipoUso técnicoSequência
DeepSeek-VL-1.3B-baseBasePesquisa, avaliação e adaptação4.096
DeepSeek-VL-1.3B-chatChatProtótipos conversacionais com imagem e texto4.096
DeepSeek-VL-7B-baseBaseExperimentos com maior capacidade e ajuste4.096
DeepSeek-VL-7B-chatChatPerguntas visuais e interação multimodal4.096

“Base” e “chat” não representam planos comerciais. A variante base é voltada à pesquisa e adaptação; a variante chat foi preparada para seguir instruções e conversar. A escolha deve considerar o model card, os recursos de hardware e o tipo de avaliação que será executado.

O que pode ser testado com DeepSeek VL

  • Descrição de imagens: gerar uma descrição inicial de cenas, objetos ou interfaces.
  • Visual question answering: responder a perguntas específicas sobre uma imagem.
  • OCR assistido: identificar e contextualizar texto presente em capturas, formulários ou páginas digitalizadas.
  • Documentos: explorar relações entre texto, layout, tabelas e elementos visuais.
  • Gráficos e tabelas: identificar rótulos e relações aparentes, sempre conferindo os valores na fonte.
  • Páginas web e interfaces: analisar screenshots para pesquisa de UX ou documentação.
  • Fórmulas e conteúdo técnico: testar reconhecimento e explicação de material científico visual.

Essas são categorias de avaliação, não garantias de precisão. Um benchmark ou uma demonstração não prova desempenho suficiente em documentos próprios, idioma português, imagens degradadas ou decisões de alto impacto.

DeepSeek VL e DeepSeek-VL2

O DeepSeek-VL2 é a continuação técnica da linha. Ele usa uma arquitetura vision-language Mixture-of-Experts e foi publicado nas variantes Tiny, Small e VL2, com 1,0B, 2,8B e 4,5B parâmetros ativados, respectivamente. O repositório destaca VQA, OCR, documentos, tabelas, gráficos e visual grounding.

CritérioDeepSeek-VLDeepSeek-VL2
Publicação da famíliaMarço de 2024Dezembro de 2024
Arquitetura geralCodificador visual híbrido, adaptador e LLMVision-language MoE
Variantes1.3B e 7B, base/chatTiny, Small e VL2
Sequência listada4.0964.096
Interpretação corretaFamília originalSucessor técnico, não endpoint hospedado atual

A API atual aceita imagens?

Sim, por um modelo específico. A API aceita imagens quando model é deepseek-v4-flash-vision-exp. O modelo recebe JPEG, PNG, GIF e WebP junto com texto em Chat Completions, Responses API e Anthropic API. As imagens podem ser enviadas em Base64, por URL HTTP(S) pública ou por file_id da Files API.

Isso não torna DeepSeek-VL ou DeepSeek-VL2 modelos hospedados. Também não transforma a Files API em leitor universal de PDF: o serviço atual documenta upload e reutilização de imagens para o Vision Exp. Para PDFs ou bases documentais, extração, OCR, segmentação, indexação, permissões, citações e avaliação continuam sob responsabilidade da aplicação. Para formatos, limites e uso hospedado atual, consulte o guia do DeepSeek V4 com Vision Exp.

Quando escolher cada opção?

  • Use Vision Exp hospedado quando quiser uma API gerenciada para imagens, aceitar o estado experimental e trabalhar dentro dos formatos, limites e preços atuais.
  • Use DeepSeek-VL ou VL2 self-hosted quando precisar estudar ou executar um checkpoint específico e puder administrar hardware, dependências, segurança, logs e licença.
  • Não compare qualidade ou custo entre as duas rotas sem registrar modelo, revisão, hardware, protocolo, resolução, idioma e rubrica.

Fluxo responsável para testes locais

Os exemplos oficiais instalam o pacote do repositório e carregam pesos pelo ecossistema Transformers. Antes de executar qualquer exemplo, trate o repositório, o model card e as dependências como código de terceiros que precisa de revisão.

git clone --depth 1 https://github.com/deepseek-ai/DeepSeek-VL.git
cd DeepSeek-VL

# Registre exatamente o código avaliado.
git rev-parse HEAD | tee REVISION_USED.txt

python -m venv .venv
source .venv/bin/activate
python -m pip install --upgrade pip
python -m pip install -e .

Para uma execução reproduzível, revise o commit registrado, congele dependências e guarde o hash dos arquivos de pesos. Se um carregamento exigir trust_remote_code=True, entenda que isso autoriza a execução de código fornecido pelo repositório do modelo: fixe uma revisão já revisada, use ambiente isolado e não execute com credenciais ou acesso a dados de produção.

  1. Leia o model card e as duas licenças antes do download.
  2. Comece com imagens públicas e sem dados pessoais.
  3. Registre modelo, revisão, GPU, bibliotecas e prompt.
  4. Crie um conjunto de respostas esperadas para OCR, tabelas e VQA.
  5. Meça erros por campo ou caractere; não avalie apenas pela fluência.
  6. Revise manualmente cada resultado usado fora do ambiente de teste.

Limitações e riscos

  • OCR: um caractere, separador decimal ou sinal incorreto pode mudar o significado do documento.
  • Gráficos: o modelo pode confundir legenda, escala, eixo ou série.
  • Layouts: colunas, rodapés e tabelas extensas podem ser lidos fora de ordem.
  • Infraestrutura: GPU, memória, CUDA, PyTorch e versões incompatíveis podem impedir a execução.
  • Segurança: pesos, dependências e código remoto precisam de revisão e isolamento.
  • Privacidade: execução local só oferece mais controle quando logs, plugins, rede, armazenamento e acesso também estão sob controle.
  • Uso sensível: saúde, direito, finanças, segurança e engenharia exigem verificação humana qualificada.

Licença e uso comercial

O repositório informa que o código do DeepSeek-VL usa licença MIT, enquanto os modelos Base/Chat seguem a DeepSeek Model License. O projeto declara suporte a uso comercial sob esses termos. Isso não significa que código e pesos tenham a mesma licença, nem substitui a leitura das condições aplicáveis ao modelo, às dependências, aos dados de entrada e ao produto final.

Perguntas frequentes sobre DeepSeek VL

DeepSeek VL é um modelo atual da API?

Não. DeepSeek-VL e DeepSeek-VL2 são famílias de pesos publicadas. O modelo visual hospedado atual é outro: deepseek-v4-flash-vision-exp.

A API oficial aceita imagens?

Sim, com o Vision Exp. Flash e Pro textuais não aceitam imagens. Use Base64, URL pública ou file_id conforme o guia de Vision; não envie imagens a um ID textual.

DeepSeek VL faz OCR?

OCR está entre os cenários documentados da família. A precisão precisa ser medida com o tipo de documento, idioma, resolução e layout do projeto; não trate a saída como transcrição certificada.

Qual variante devo testar?

Use uma variante chat para interação por instruções e uma base para pesquisa ou adaptação. Comece pela menor variante compatível com a tarefa e só aumente o custo de infraestrutura se os testes mostrarem ganho relevante.

Executar localmente mantém tudo privado?

Não automaticamente. Verifique telemetria, downloads, logs, backups, plugins, permissões, rede e quem acessa a máquina. “Local” descreve onde a inferência ocorre, não uma política de privacidade completa.

Conclusão

DeepSeek-VL e DeepSeek-VL2 continuam relevantes para estudar e executar checkpoints visuais publicados. Para uma integração gerenciada atual, a DeepSeek oferece separadamente o experimental deepseek-v4-flash-vision-exp. A escolha responsável começa pela separação entre pesos locais e serviço hospedado, continua com a leitura da licença e dos limites e termina com avaliação própria de OCR, gráficos, documentos e privacidade.

Fontes desta atualização: Vision, Files API, DeepSeek-VL e DeepSeek-VL2.