تضمين المتجهات
التضمين المتجهي (Vector Embedding) هو تمثيل رقمي لبيانات معقدة - مثل النصوص أو الصور أو الصوت أو الفيديو - في فضاء متجهي مستمر. فبدلاً من تخزين البيانات الأولية، يقوم نموذج التضمين بتحويل البيانات إلى قائمة من الأرقام (متجه) حيث يعكس تقارب هذه المتجهات التشابه الدلالي لنقاط البيانات الأصلية.
تفشل عمليات البحث التقليدية القائمة على الكلمات المفتاحية عندما يطرح المستخدمون أسئلة دقيقة. تحل التضمينات المتجهية هذه المشكلة من خلال التقاط معنى أو سياق البيانات. يتيح هذا لأنظمة الذكاء الاصطناعي فهم أن "قط كبير" قريب دلاليًا من "نمر"، حتى لو لم تتطابق الكلمات تمامًا. هذا التحول من المطابقة المعجمية إلى المطابقة الدلالية هو أساس الذكاء الاصطناعي التوليدي الحديث والتطبيقات الذكية.
تتضمن العملية عادةً شبكة عصبية مُدربة مسبقًا، وغالبًا ما تكون نموذج محوّل (Transformer). يقوم هذا النموذج باستيعاب البيانات الأولية (على سبيل المثال، جملة) ويمررها عبر طبقات متعددة. تعمل كل طبقة على تحسين فهم المدخلات، وتُخرج في النهاية متجهًا ذا طول ثابت (على سبيل المثال، 768 بُعدًا). ستحتوي نقاط البيانات ذات المعاني المتشابهة على متجهات تكون قريبة رياضيًا من بعضها البعض في الفضاء عالي الأبعاد، ويتم قياس ذلك غالبًا باستخدام تشابه جيب التمام (cosine similarity).
تُشغّل التضمينات المتجهية العديد من الوظائف التجارية الهامة: