وقت تشغيل الآلة
يشير وقت تشغيل الآلة (Machine Runtime) إلى الفترة التشغيلية التي تقوم خلالها آلة أو برنامج أو نموذج حاسوبي بتنفيذ المهام بنشاط. في سياق الذكاء الاصطناعي والأنظمة واسعة النطاق، يقيس هذا المقياس تحديداً الوقت والموارد المستهلكة أثناء قيام نموذج مُدرَّب بإجراء تنبؤات أو أثناء تشغيل العمليات الآلية.
يُعد هذا المقياس حاسماً لفهم الكفاءة الواقعية للأنظمة المنشورة، حيث يتجاوز مجرد وقت التدريب للتركيز على زمن الاستدلال والحمل التشغيلي.
بالنسبة للشركات التي تنشر حلول الذكاء الاصطناعي، يرتبط وقت تشغيل الآلة ارتباطاً مباشراً بالتكاليف التشغيلية وتجربة المستخدم. يؤدي ارتفاع وقت التشغيل إلى زيادة نفقات الحوسبة السحابية (على سبيل المثال، استخدام وحدات معالجة الرسومات/وحدات المعالجة المركزية) واحتمال تباطؤ أوقات الاستجابة للمستخدمين النهائيين.
يضمن تحسين وقت التشغيل أن النموذج المنشور فعال من حيث التكلفة ويلبي اتفاقيات مستوى الخدمة (SLAs) الصارمة فيما يتعلق بزمن الاستجابة.
يتم تحديد وقت التشغيل من خلال عدة عوامل، بما في ذلك مدى تعقيد بنية النموذج، وحجم بيانات الإدخال (حجم الدفعة)، والأجهزة الأساسية (وحدة المعالجة المركزية مقابل وحدة معالجة الرسومات)، وكفاءة محرك الاستدلال المستخدم.
عندما يعمل النموذج، فإنه يتطلب دورات حاسوبية لمعالجة ميزات الإدخال عبر طبقاته لتوليد مخرج. يلتقط وقت التشغيل المدة الإجمالية لهذه الدورة.
يتم تتبع وقت تشغيل الآلة بشكل مكثف في عدة مجالات:
يؤدي تحسين وقت تشغيل الآلة إلى فوائد تجارية ملموسة:
غالباً ما تنشأ التحديات من حجم النموذج وبيئة النشر. تتطلب النماذج الأساسية الكبيرة والمعقدة بطبيعتها وقتاً حاسوبياً أكبر. علاوة على ذلك، فإن إدارة وقت التشغيل عبر الأجهزة المتباينة (على سبيل المثال، الانتقال من الاستدلال المحلي بوحدة المعالجة المركزية إلى وحدات TPUs الطرفية المتخصصة) يضيف تعقيداً.
تشمل المفاهيم ذات الصلة ارتباطاً وثيقاً زمن استجابة الاستدلال (الوقت اللازم لتنبؤ واحد)، ومعدل الإنتاجية (عدد التنبؤات في وحدة زمنية)، وكفاءة النموذج (نسبة الأداء إلى التكلفة الحاسوبية).