نموذج لغوي بصري
نموذج اللغة المرئي (VLM) هو نوع من نماذج الذكاء الاصطناعي مصمم لمعالجة وفهم المعلومات بسلاسة من المدخلات البصرية (الصور أو مقاطع الفيديو) والمدخلات النصية (اللغة). على عكس النماذج التقليدية التي تتخصص إما في الرؤية أو اللغة، تعمل نماذج VLM على سد هذه الفجوة، مما يسمح لها بتفسير العلاقة بين ما تُظهره الصورة وما تصفه الكلمات.
تمثل نماذج VLM قفزة نوعية في قدرات الذكاء الاصطناعي متعدد الوسائط. فهي تمكّن الآلات من "رؤية" و"فهم" العالم بطريقة تحاكي الإدراك البشري. بالنسبة للشركات، يعني هذا تجاوز مجرد التعرف على الصور إلى الفهم السياقي المعقد، مما يفتح مستويات جديدة من الأتمتة واستخلاص البيانات من الوسائط المرئية.
تتضمن الوظيفة الأساسية لنموذج VLM دمج نمطين متميزين - الرؤية واللغة - في مساحة تمثيل موحدة. يتم تحقيق ذلك عادةً باستخدام مُشفِّرات متخصصة: يقوم مُشفِّر الرؤية (مثل شبكة CNN أو محول الرؤية) بمعالجة الصورة إلى تضمين رقمي، ويقوم مُشفِّر اللغة (مثل المحول) بمعالجة النص إلى تضمين آخر. بعد ذلك، يتم محاذاة هذه التضمينات ودمجها، مما يسمح للنموذج بأداء مهام تتطلب استدلالاً عبر كلا المجالين.
تشمل المفاهيم ذات الصلة التعلم متعدد الوسائط، ونماذج اللغة الكبيرة (LLMs)، وأنظمة الرؤية الحاسوبية. يمكن النظر إلى نماذج VLM على أنها تكامل متقدم لنماذج LLMs مع وحدات إدراك بصري قوية.