Modèle de langage visuel
Un Modèle de Langage Visuel (VLM) est un type de modèle d'intelligence artificielle conçu pour traiter et comprendre de manière transparente les informations provenant à la fois d'entrées visuelles (images ou vidéos) et d'entrées textuelles (langage). Contrairement aux modèles traditionnels qui se spécialisent soit dans la vision, soit dans le langage, les VLM comblent cette lacune, leur permettant d'interpréter la relation entre ce qu'une image montre et ce que les mots la décrivent.
Les VLM représentent un bond significatif dans les capacités de l'IA multimodale. Ils permettent aux machines de « voir » et de « comprendre » le monde d'une manière qui reflète la perception humaine. Pour les entreprises, cela signifie aller au-delà de la simple reconnaissance d'images pour atteindre une compréhension contextuelle complexe, débloquant de nouveaux niveaux d'automatisation et d'extraction de données à partir de médias visuels.
La fonction principale d'un VLM consiste à fusionner deux modalités distinctes — la vision et le langage — en un espace de représentation unifié. Ceci est généralement réalisé en utilisant des encodeurs spécialisés : un encodeur visuel (comme un CNN ou un Vision Transformer) traite l'image en un plongement numérique, et un encodeur de langage (comme un Transformer) traite le texte en un autre plongement. Ces plongements sont ensuite alignés et combinés, permettant au modèle d'effectuer des tâches nécessitant un raisonnement à travers les deux domaines.
Les concepts connexes comprennent l'apprentissage multimodal, les grands modèles de langage (LLM) et les systèmes de vision par ordinateur. Les VLM peuvent être considérés comme une intégration avancée des LLM avec des modules de perception visuelle puissants.