الضبط الدقيق المُراقب
الضبط الدقيق الخاضع للإشراف (SFT) هو عملية حاسمة في التعلم الآلي التطبيقي، حيث يتم تدريب نموذج كبير مُدرب مسبقًا على مجموعة بيانات أصغر وعالية الجودة ومُصنفة ومخصصة لمهمة مستهدفة. الهدف هو تكييف المعرفة العامة المضمنة في النموذج الأساسي للتفوق في المتطلبات المتخصصة الخاصة بمجال معين.
النماذج ذات الأغراض العامة، على الرغم من قوتها، غالبًا ما تفتقر إلى الفروق الدقيقة المطلوبة للتطبيقات المؤسسية المتخصصة. يعمل SFT على سد هذه الفجوة عن طريق حقن الخبرة في المجال مباشرة في أوزان النموذج. وينتج عن ذلك مخرجات ليست صحيحة نحويًا فحسب، بل دقيقة سياقيًا ومتوافقة أيضًا مع بروتوكولات عمل محددة أو مصطلحات صناعية معينة.
تبدأ العملية بنموذج أساسي (على سبيل المثال، نموذج محول كبير) تم تدريبه بالفعل على مجموعات بيانات ضخمة ومتنوعة. في SFT، يتم بعد ذلك تعريض هذا النموذج لأزواج من المطالبات المدخلة والمخرجات المرغوبة التي يقدمها الخبراء. يقوم النموذج بتعديل معاملاته الداخلية بشكل تكراري لتقليل الفرق بين تنبؤاته والتصنيفات الحقيقية المقدمة في مجموعة بيانات الضبط الدقيق.
يُستخدم SFT على نطاق واسع عبر مختلف الوظائف التجارية:
تشمل المزايا الأساسية لـ SFT تحقيق مكاسب كبيرة في الأداء للمهام المستهدفة، وتقليل زمن الاستدلال مقارنةً بتوجيه النماذج الضخمة بتعليمات معقدة، وتحسين الالتزام بنبرة العلامة التجارية أو القيود التنظيمية.
تتضمن التحديات الرئيسية جودة وكمية البيانات المُصنفة. ستؤدي بيانات التدريب سيئة التنسيق أو المتحيزة إلى نموذج مضبوط بدقة رديء. علاوة على ذلك، يمكن أن تكون الموارد الحاسوبية المطلوبة لعملية الضبط الدقيق نفسها كبيرة.
تتعلق هذه العملية ارتباطًا وثيقًا بالتعلم المعزز من التغذية الراجعة البشرية (RLHF)، والذي غالبًا ما يتبع SFT لمواءمة سلوك النموذج بشكل أكبر بعد الضبط الأولي الخاص بالمهمة.