النموذج المُكمَّم
النموذج المُكمَّم (Quantized Model) هو نسخة من نموذج تعلم آلي مُدرب حيث تم تقليل الدقة العددية لأوزانه وتنشيطاته. عادةً، يتم تدريب النماذج باستخدام أرقام النقطة العائمة ذات الـ 32 بت (FP32). تقوم عملية التكميم بتحويل هذه القيم عالية الدقة إلى تمثيلات ذات بتات أقل، مثل الأرقام العائمة ذات الـ 16 بت (FP16)، أو الأعداد الصحيحة ذات الـ 8 بت (INT8)، أو حتى أقل.
يُعد حجم النموذج والمتطلبات الحسابية من المعوقات الرئيسية في نشر نماذج الذكاء الاصطناعي الكبيرة، خاصة على الأجهزة الطرفية (Edge Devices) أو في بيئات السحابة ذات الموارد المحدودة. يعالج التكميم هذه المشكلة بشكل مباشر عن طريق تقليل البصمة الذاكرية وعدد العمليات الحسابية المطلوبة (FLOPs) أثناء الاستدلال (Inference) بشكل كبير.
تُترجم مكاسب الكفاءة هذه مباشرة إلى أوقات استدلال أسرع، وزمن انتقال (Latency) أقل، وتكاليف تشغيلية منخفضة للشركات التي تقوم بتشغيل أعباء عمل الذكاء الاصطناعي على نطاق واسع.
الفكرة الأساسية هي تعيين نطاق مستمر من قيم النقطة العائمة إلى مجموعة منفصلة من القيم ذات الدقة الأقل. تتضمن هذه العملية تحديد عامل قياس (Scaling Factor) ونقطة صفر (Zero-Point) لكل موتر (Tensor). يتم تعيين قيمة FP32 الأصلية إلى قيمة عدد صحيح ضمن نطاق عرض البت المختار. هناك عدة تقنيات، منها التكميم بعد التدريب (Post-Training Quantization - PTQ)، حيث يحدث التكميم بعد التدريب، والتدريب المدرك للتكميم (Quantization-Aware Training - QAT)، حيث يتم تدريب النموذج باستخدام ضوضاء تكميم مُحاكاة لتقليل فقدان الدقة.
تُعد النماذج المُكمَّمة حاسمة للعديد من تطبيقات الذكاء الاصطناعي الحديثة: