DeepSeek VL é uma família de modelos de visão e linguagem publicada pela DeepSeek em 2024. Ela combina imagens e texto para tarefas como descrição visual, perguntas sobre imagens, OCR e compreensão de documentos. Esta página explica a família original, suas variantes, a arquitetura documentada, a relação com o DeepSeek-VL2 e os cuidados necessários para testes locais.
Status verificado em 23 de agosto de 2026. DeepSeek-VL e DeepSeek-VL2 continuam sendo famílias de pesos publicadas para pesquisa e execução própria; nenhuma delas é um ID hospedado atual. Desde 21/08/2026, a API oficial aceita imagens por meio de um modelo diferente e experimental:
deepseek-v4-flash-vision-exp. Não há base oficial para chamar o Vision Exp de “DeepSeek-VL3”, de alias do VL/VL2 ou de checkpoint equivalente.
O DeepSeek Português é um guia independente, operado por terceiros e sem afiliação, patrocínio ou endosso da DeepSeek. Para disponibilidade, licenças e requisitos técnicos, confirme sempre o repositório ou a documentação oficial citada nesta página.
Resumo do DeepSeek VL
| Aspecto | Informação verificada |
|---|---|
| Natureza | Família de modelos de visão e linguagem com pesos publicados |
| Lançamento da família original | 11 de março de 2024 |
| Variantes originais | 1.3B-base, 1.3B-chat, 7B-base e 7B-chat |
| Comprimento de sequência documentado | 4.096 tokens nas quatro variantes |
| Entradas | Imagem e texto no runtime da família DeepSeek-VL |
| Tarefas | VQA, descrição de imagens, OCR, páginas web, documentos, tabelas, gráficos e fórmulas |
| API hospedada atual | DeepSeek-VL e VL2 não aparecem como model IDs hospedados |
| Licenças | Código sob MIT; modelos Base/Chat sujeitos à DeepSeek Model License |
Não confunda três superfícies diferentes
| Superfície | O que é | Como acessar | O que não afirmar |
|---|---|---|---|
| DeepSeek-VL | Família original de pesos de 2024 | Repositório/model card e runtime próprio | Não é ID da API atual |
| DeepSeek-VL2 | Sucessor técnico com arquitetura MoE | Repositório/model card e runtime próprio | Não é endpoint hospedado atual |
| V4 Flash Vision Exp | Modelo multimodal hospedado experimental de 2026 | deepseek-v4-flash-vision-exp | Não afirmar que usa pesos VL/VL2 ou que tem pesos publicados sem fonte |
As tarefas podem se sobrepor — descrição de imagens, leitura de screenshots, gráficos e OCR assistido —, mas isso não torna os modelos tecnicamente iguais. Compare a versão exata, a licença, a superfície de acesso e o protocolo utilizado.
O que é DeepSeek VL?
Um vision-language model, ou VLM, recebe informação visual e textual na mesma tarefa. Em vez de analisar apenas palavras, o sistema transforma a imagem em representações que o componente de linguagem consegue usar para responder a uma pergunta, descrever elementos ou relacionar texto e imagem.
O repositório oficial do DeepSeek-VL descreve aplicações em diagramas lógicos, páginas web, reconhecimento de fórmulas, literatura científica, imagens naturais e cenários visuais complexos. A família foi disponibilizada em tamanhos de 1,3 bilhão e 7 bilhões de parâmetros, cada um com uma variante base e outra preparada para conversação.
Esse escopo não transforma o modelo em um serviço pronto. Os pesos, o código de inferência e o aplicativo oficial da DeepSeek são superfícies diferentes. Quem executa DeepSeek-VL precisa escolher infraestrutura, proteger os arquivos processados, validar a saída e cumprir as licenças aplicáveis.
Como a arquitetura funciona
A arquitetura documentada pode ser entendida como três partes: um codificador visual, um adaptador que aproxima a representação da imagem do espaço linguístico e um modelo de linguagem que produz a resposta. O treinamento multimodal conecta essas partes para que a geração considere o conteúdo visual e a instrução textual.
Codificador visual híbrido
Na variante 7B, a documentação descreve um codificador híbrido que combina SigLIP-L e SAM-B e trabalha com imagens de até 1.024 × 1.024 pixels. A proposta é preservar informação semântica e detalhes locais, algo importante para caracteres pequenos, elementos de interface, rótulos de gráficos e layouts densos.
Adaptador de visão
O adaptador converte as representações produzidas pelo codificador visual para um formato que o modelo de linguagem possa consumir. Ele é a ponte entre o que foi detectado na imagem e a sequência textual usada na geração.
Componente de linguagem
O componente de linguagem interpreta a instrução, relaciona-a com os sinais visuais e gera a resposta. A resposta pode parecer convincente mesmo quando a leitura visual está errada; por isso, a arquitetura não elimina a necessidade de validação.
Variantes publicadas
| Variante | Tipo | Uso técnico | Sequência |
|---|---|---|---|
DeepSeek-VL-1.3B-base | Base | Pesquisa, avaliação e adaptação | 4.096 |
DeepSeek-VL-1.3B-chat | Chat | Protótipos conversacionais com imagem e texto | 4.096 |
DeepSeek-VL-7B-base | Base | Experimentos com maior capacidade e ajuste | 4.096 |
DeepSeek-VL-7B-chat | Chat | Perguntas visuais e interação multimodal | 4.096 |
“Base” e “chat” não representam planos comerciais. A variante base é voltada à pesquisa e adaptação; a variante chat foi preparada para seguir instruções e conversar. A escolha deve considerar o model card, os recursos de hardware e o tipo de avaliação que será executado.
O que pode ser testado com DeepSeek VL
- Descrição de imagens: gerar uma descrição inicial de cenas, objetos ou interfaces.
- Visual question answering: responder a perguntas específicas sobre uma imagem.
- OCR assistido: identificar e contextualizar texto presente em capturas, formulários ou páginas digitalizadas.
- Documentos: explorar relações entre texto, layout, tabelas e elementos visuais.
- Gráficos e tabelas: identificar rótulos e relações aparentes, sempre conferindo os valores na fonte.
- Páginas web e interfaces: analisar screenshots para pesquisa de UX ou documentação.
- Fórmulas e conteúdo técnico: testar reconhecimento e explicação de material científico visual.
Essas são categorias de avaliação, não garantias de precisão. Um benchmark ou uma demonstração não prova desempenho suficiente em documentos próprios, idioma português, imagens degradadas ou decisões de alto impacto.
DeepSeek VL e DeepSeek-VL2
O DeepSeek-VL2 é a continuação técnica da linha. Ele usa uma arquitetura vision-language Mixture-of-Experts e foi publicado nas variantes Tiny, Small e VL2, com 1,0B, 2,8B e 4,5B parâmetros ativados, respectivamente. O repositório destaca VQA, OCR, documentos, tabelas, gráficos e visual grounding.
| Critério | DeepSeek-VL | DeepSeek-VL2 |
|---|---|---|
| Publicação da família | Março de 2024 | Dezembro de 2024 |
| Arquitetura geral | Codificador visual híbrido, adaptador e LLM | Vision-language MoE |
| Variantes | 1.3B e 7B, base/chat | Tiny, Small e VL2 |
| Sequência listada | 4.096 | 4.096 |
| Interpretação correta | Família original | Sucessor técnico, não endpoint hospedado atual |
A API atual aceita imagens?
Sim, por um modelo específico. A API aceita imagens quando
modelédeepseek-v4-flash-vision-exp. O modelo recebe JPEG, PNG, GIF e WebP junto com texto em Chat Completions, Responses API e Anthropic API. As imagens podem ser enviadas em Base64, por URL HTTP(S) pública ou porfile_idda Files API.
Isso não torna DeepSeek-VL ou DeepSeek-VL2 modelos hospedados. Também não transforma a Files API em leitor universal de PDF: o serviço atual documenta upload e reutilização de imagens para o Vision Exp. Para PDFs ou bases documentais, extração, OCR, segmentação, indexação, permissões, citações e avaliação continuam sob responsabilidade da aplicação. Para formatos, limites e uso hospedado atual, consulte o guia do DeepSeek V4 com Vision Exp.
Quando escolher cada opção?
- Use Vision Exp hospedado quando quiser uma API gerenciada para imagens, aceitar o estado experimental e trabalhar dentro dos formatos, limites e preços atuais.
- Use DeepSeek-VL ou VL2 self-hosted quando precisar estudar ou executar um checkpoint específico e puder administrar hardware, dependências, segurança, logs e licença.
- Não compare qualidade ou custo entre as duas rotas sem registrar modelo, revisão, hardware, protocolo, resolução, idioma e rubrica.
Fluxo responsável para testes locais
Os exemplos oficiais instalam o pacote do repositório e carregam pesos pelo ecossistema Transformers. Antes de executar qualquer exemplo, trate o repositório, o model card e as dependências como código de terceiros que precisa de revisão.
git clone --depth 1 https://github.com/deepseek-ai/DeepSeek-VL.git
cd DeepSeek-VL
# Registre exatamente o código avaliado.
git rev-parse HEAD | tee REVISION_USED.txt
python -m venv .venv
source .venv/bin/activate
python -m pip install --upgrade pip
python -m pip install -e .
Para uma execução reproduzível, revise o commit registrado, congele dependências e guarde o hash dos arquivos de pesos. Se um carregamento exigir trust_remote_code=True, entenda que isso autoriza a execução de código fornecido pelo repositório do modelo: fixe uma revisão já revisada, use ambiente isolado e não execute com credenciais ou acesso a dados de produção.
- Leia o model card e as duas licenças antes do download.
- Comece com imagens públicas e sem dados pessoais.
- Registre modelo, revisão, GPU, bibliotecas e prompt.
- Crie um conjunto de respostas esperadas para OCR, tabelas e VQA.
- Meça erros por campo ou caractere; não avalie apenas pela fluência.
- Revise manualmente cada resultado usado fora do ambiente de teste.
Limitações e riscos
- OCR: um caractere, separador decimal ou sinal incorreto pode mudar o significado do documento.
- Gráficos: o modelo pode confundir legenda, escala, eixo ou série.
- Layouts: colunas, rodapés e tabelas extensas podem ser lidos fora de ordem.
- Infraestrutura: GPU, memória, CUDA, PyTorch e versões incompatíveis podem impedir a execução.
- Segurança: pesos, dependências e código remoto precisam de revisão e isolamento.
- Privacidade: execução local só oferece mais controle quando logs, plugins, rede, armazenamento e acesso também estão sob controle.
- Uso sensível: saúde, direito, finanças, segurança e engenharia exigem verificação humana qualificada.
Licença e uso comercial
O repositório informa que o código do DeepSeek-VL usa licença MIT, enquanto os modelos Base/Chat seguem a DeepSeek Model License. O projeto declara suporte a uso comercial sob esses termos. Isso não significa que código e pesos tenham a mesma licença, nem substitui a leitura das condições aplicáveis ao modelo, às dependências, aos dados de entrada e ao produto final.
Perguntas frequentes sobre DeepSeek VL
DeepSeek VL é um modelo atual da API?
Não. DeepSeek-VL e DeepSeek-VL2 são famílias de pesos publicadas. O modelo visual hospedado atual é outro: deepseek-v4-flash-vision-exp.
A API oficial aceita imagens?
Sim, com o Vision Exp. Flash e Pro textuais não aceitam imagens. Use Base64, URL pública ou file_id conforme o guia de Vision; não envie imagens a um ID textual.
DeepSeek VL faz OCR?
OCR está entre os cenários documentados da família. A precisão precisa ser medida com o tipo de documento, idioma, resolução e layout do projeto; não trate a saída como transcrição certificada.
Qual variante devo testar?
Use uma variante chat para interação por instruções e uma base para pesquisa ou adaptação. Comece pela menor variante compatível com a tarefa e só aumente o custo de infraestrutura se os testes mostrarem ganho relevante.
Executar localmente mantém tudo privado?
Não automaticamente. Verifique telemetria, downloads, logs, backups, plugins, permissões, rede e quem acessa a máquina. “Local” descreve onde a inferência ocorre, não uma política de privacidade completa.
Conclusão
DeepSeek-VL e DeepSeek-VL2 continuam relevantes para estudar e executar checkpoints visuais publicados. Para uma integração gerenciada atual, a DeepSeek oferece separadamente o experimental deepseek-v4-flash-vision-exp. A escolha responsável começa pela separação entre pesos locais e serviço hospedado, continua com a leitura da licença e dos limites e termina com avaliação própria de OCR, gráficos, documentos e privacidade.
Fontes desta atualização: Vision, Files API, DeepSeek-VL e DeepSeek-VL2.