Modelo de Linguagem Visual
Um Modelo de Linguagem Visual (VLM) é um tipo de modelo de inteligência artificial projetado para processar e entender informações de forma integrada tanto de entradas visuais (imagens ou vídeos) quanto de entradas textuais (linguagem). Diferentemente dos modelos tradicionais que se especializam em visão ou linguagem, os VLMs preenchem essa lacuna, permitindo-lhes interpretar a relação entre o que uma imagem mostra e o que as palavras descrevem.
Os VLMs representam um salto significativo na capacidade de IA multimodal. Eles permitem que as máquinas "vejam" e "entendam" o mundo de uma maneira que espelha a percepção humana. Para os negócios, isso significa ir além do simples reconhecimento de imagens para um entendimento contextual complexo, desbloqueando novos níveis de automação e extração de dados de mídias visuais.
A função central de um VLM envolve fundir duas modalidades distintas — visão e linguagem — em um espaço de representação unificado. Isso é tipicamente alcançado usando codificadores especializados: um codificador de visão (como uma CNN ou Vision Transformer) processa a imagem em um embedding numérico, e um codificador de linguagem (como um Transformer) processa o texto em outro embedding. Esses embeddings são então alinhados e combinados, permitindo que o modelo execute tarefas que exigem raciocínio em ambos os domínios.
Conceitos relacionados incluem aprendizado multimodal, grandes modelos de linguagem (LLMs) e sistemas de visão computacional. Os VLMs podem ser vistos como uma integração avançada de LLMs com módulos poderosos de percepção visual.