Recherche multimodale
La recherche multimodale fait référence à une capacité de recherche sophistiquée qui permet aux utilisateurs de saisir et de requêter des informations en utilisant plusieurs types de données simultanément. Au lieu d'être limitée aux chaînes de caractères, ces systèmes peuvent traiter et comprendre des entrées telles que des images, des clips audio, des images vidéo et du texte concurremment afin de fournir des résultats hautement pertinents.
Dans le paysage numérique moderne, l'intention de l'utilisateur est rarement unique. Les utilisateurs naviguent souvent visuellement ou décrivent des concepts verbalement. La recherche multimodale comble cette lacune, allant au-delà de la simple correspondance de mots-clés pour atteindre une véritable compréhension sémantique. Cette capacité est essentielle pour améliorer l'engagement des utilisateurs, réduire la friction dans la découverte et dégager des aperçus plus profonds à partir de jeux de données complexes et diversifiés.
Au cœur de la recherche multimodale se trouvent des modèles d'apprentissage automatique avancés, souvent de grands modèles fondamentaux. Ces modèles sont entraînés sur de vastes ensembles de données qui associent différentes modalités (par exemple, une image associée à sa légende descriptive). Le système apprend un espace d'intégration (embedding) partagé et de haute dimension où les concepts provenant de différents formats — une photo d'un chien et le mot « canidé » — sont situés à proximité. Lorsqu'une requête arrive, le système convertit l'entrée (qu'il s'agisse d'une image ou de texte) en cette représentation vectorielle partagée et recherche dans la base de données les correspondances les plus proches.
Recherche sémantique, Bases de données vectorielles, IA générative, Vision par ordinateur, Traitement du langage naturel (NLP)