استدلال وحدة معالجة الرسوميات
استدلال وحدة معالجة الرسوميات (GPU inference) هو عملية استخدام نموذج تعلم آلي مُدرَّب لإجراء تنبؤات أو توليد مخرجات على بيانات جديدة وغير مرئية. فبينما يتطلب التدريب قوة حاسوبية هائلة لضبط أوزان النموذج، فإن الاستدلال هو المرحلة التشغيلية التي يتم فيها نشر النموذج النهائي لأداء المهام في تطبيق واقعي.
في تطبيقات الذكاء الاصطناعي الحديثة، يؤثر مدى سرعة وكفاءة الاستدلال بشكل مباشر على تجربة المستخدم والتكلفة التشغيلية. يعد الاستدلال منخفض الكمون (low-latency inference) أمرًا بالغ الأهمية للأنظمة في الوقت الفعلي مثل المركبات ذاتية القيادة، ومحركات التوصية المباشرة، وروبوتات الدردشة. ويضمن الاستخدام الفعال لوحدة معالجة الرسوميات (GPU) أن خدمات الذكاء الاصطناعي ذات الإنتاجية العالية يمكن أن تتوسع بتكلفة معقولة.
عند تدريب نموذج ما، يتم تثبيت معلماته. أثناء الاستدلال، يتم تغذية بيانات الإدخال (على سبيل المثال، صورة، أو موجه نصي) عبر بنية النموذج. تتفوق وحدة معالجة الرسوميات (GPU)، بآلاف أنوية المعالجة المتوازية لديها، في إجراء عمليات ضرب المصفوفات الضخمة التي تتطلبها الشبكات العصبية بشكل متزامن. إن قدرة المعالجة المتوازية هذه هي ما يسمح للنماذج المعقدة بتنفيذ التنبؤات في أجزاء من الثانية.