مصنِّف السلامة
المُصنِّف الأمني (Safety Classifier) هو نموذج تعلم آلي متخصص مصمم لتحليل البيانات المدخلة، سواء كانت نصوصًا أو صورًا أو شيفرات برمجية، لتحديد ما إذا كانت تنتهك سياسات أمان محددة مسبقًا أو تحتوي على محتوى ضار. تتمثل وظيفته الأساسية في العمل كحارس بوابة، حيث يقوم بوضع علامة على المحتوى أو رفضه قبل وصوله إلى المستخدمين النهائيين أو معالجته بشكل إضافي من قبل الأنظمة اللاحقة.
في عصر الذكاء الاصطناعي التوليدي، فإن احتمالية إساءة الاستخدام - مثل توليد خطاب الكراهية، أو المعلومات المضللة، أو التعليمات الخطرة - كبيرة. تُعد المُصنفات الأمنية أمرًا بالغ الأهمية للحفاظ على سمعة العلامة التجارية، وضمان الامتثال القانوني، والحفاظ على المعايير الأخلاقية. فهي توفر طبقة دفاع آلية ضد المخرجات السامة أو المحظورة.
يتم تدريب المصنف على مجموعات بيانات ضخمة مُصنَّفة بدقة لأنواع مختلفة من الضرر (مثل العنف، أو المحتوى الجنسي، أو إيذاء الذات، أو التحيز). عند تقديم بيانات جديدة، يقوم النموذج بحساب درجة احتمالية عبر عدة فئات مخاطر محددة. إذا تجاوزت الدرجة لأي فئة عتبة محددة مسبقًا، يتم وضع علامة على المحتوى للمراجعة أو يتم حظره تلقائيًا.
تشمل المفاهيم ذات الصلة تصفية المحتوى، وضوابط المدخلات/المخرجات، واكتشاف السمية، ومواءمة الذكاء الاصطناعي.