تقطير النماذج
تُعد تقطير النماذج (Model Distillation) تقنية لضغط النماذج حيث يُستخدم نموذج كبير وعالي الأداء (يُسمى نموذج "المعلم") لتدريب نموذج أصغر وأبسط (يُسمى نموذج "الطالب"). فبدلاً من تدريب نموذج الطالب على تسميات الحقيقة المطلقة فقط، يتم تدريبه أيضًا على محاكاة احتمالات المخرجات (التي تُسمى "الأهداف الناعمة") التي يولدها نموذج المعلم.
في مجال الذكاء الاصطناعي الحديث، غالبًا ما تكون النماذج المتطورة ضخمة، مما يتطلب موارد حاسوبية كبيرة (زمن استجابة عالٍ، وبصمة ذاكرة كبيرة). وهذا يجعل النشر صعبًا على الأجهزة ذات الموارد المحدودة مثل الهواتف المحمولة، أو مستشعرات إنترنت الأشياء (IoT)، أو في بيئات الحوسبة الطرفية في الوقت الفعلي. يتيح التقطير للمؤسسات الاحتفاظ بالكثير من المعرفة المعقدة التي يمتلكها المعلم مع تقليل حجم الطالب ووقت الاستدلال بشكل كبير.
تتضمن الآلية الأساسية نقل "المعرفة الخفية" (dark knowledge). لا ينتج نموذج المعلم تنبؤًا حادًا فحسب (مثل "قطة")، بل ينتج توزيعًا احتماليًا عبر جميع الفئات الممكنة (مثل 90% قطة، 8% كلب، 2% طائر). يحتوي هذا التوزيع على معلومات دقيقة حول عدم يقين النموذج والعلاقات بين الفئات. بعد ذلك، يتم تدريب نموذج الطالب باستخدام دالة خسارة مجمعة: يقلل أحد المكونات من الفرق بين تنبؤاته والتسميات الحقيقية (الأهداف الصلبة)، ويقلل المكون الثاني من الفرق بين تنبؤاته والأهداف الناعمة للمعلم.