المسترجع واسع النطاق
المُسترجِع واسع النطاق (Large-Scale Retriever) هو مكون متطور ضمن نظام الذكاء الاصطناعي، يُستخدم عادةً في معماريات التوليد المعزز بالاسترجاع (RAG). تتمثل وظيفته الأساسية في البحث بكفاءة في مجموعات البيانات الضخمة وغير المهيكلة - مثل ملايين المستندات، أو إدخالات قاعدة المعرفة، أو سجلات قواعد البيانات - واسترجاع أجزاء المعلومات الأكثر صلة دلاليًا بناءً على استعلام المستخدم.
يتجاوز هذا النظام مجرد المطابقة البسيطة للكلمات المفتاحية؛ فهو يفهم معنى وسياق الاستعلام لسحب نقاط البيانات الأكثر أهمية لنموذج اللغة الكبير (LLM) في المرحلة اللاحقة لتوليف استجابة دقيقة.
في البيئات المؤسسية، لا تكون نماذج اللغة الكبيرة جيدة إلا بقدر جودة البيانات التي تُعطى لها. بدون مُسترجِع قوي، يعتمد نموذج اللغة الكبير فقط على بيانات التدريب المسبق الخاصة به، والتي غالبًا ما تكون قديمة أو عامة جدًا لتلبية الاحتياجات التجارية المحددة. يحل المُسترجِع واسع النطاق مشكلة "الهلوسة" (hallucination) عن طريق ترسيخ مخرجات نموذج اللغة الكبير في معرفة مؤسسية موثوقة، وخاصة، ومُحدَّثة. إنه يحوّل روبوت الدردشة ذي الغرض العام إلى خبير متخصص في مجال معين.
تتضمن العملية عمومًا عدة مراحل رئيسية: