تقوم هذه الوظيفة بتنفيذ بروتوكولات إخفاء هوية البيانات المؤتمتة ضمن أنظمة التخزين، حيث تستبدل أو تقوم بتجزئة المعرّفات الحساسة بشكل منهجي قبل دخولها خط أنابيب التدريب. وهي تضمن عدم بقاء أي معلومات تعريف شخصية (PII) في مجموعة البيانات، امتثالاً للأطر التنظيمية الصارمة مثل اللائحة العامة لحماية البيانات (GDPR) وقانون خصوصية المستهلك في كاليفورنيا (CCPA). تتضمن العملية مسح المدخلات الأولية، وتطبيق خوارزميات تحويل قابلة للعكس أو غير قابلة للعكس بناءً على سياسات الاحتفاظ، والتحقق من إزالة السمات القابلة للتحديد لمنع هجمات إعادة التحديد.
يقوم النظام باستيعاب مجموعات بيانات التدريب الأولية من حاويات التخزين الآمنة ويبدأ مسحًا معمقًا للتعرف على المعلومات الشخصية القابلة لتحديد الهوية (PII) باستخدام محركات التعرف على الأنماط.
بمجرد اكتشاف المعلومات الشخصية المحددة (PII)، يطبق المحرك خوارزميات إخفاء الهوية المكوّنة - مثل إخفاء الهوية بـ k أو الخصوصية التفاضلية - لتحويل البيانات مع الحفاظ على المنفعة الإحصائية لتدريب النموذج.
تتضمن المعالجة اللاحقة خطوة تحقق تدقق في مجموعة البيانات المحولة للتأكد من عدم وجود أي أنماط قابلة للتحديد متبقية قبل الأرشفة أو الإطلاق إلى مجموعة التدريب.
مسح مجموعات البيانات الواردة لتحديد الأنماط المطابقة لهياكل معلومات التعريف الشخصية (PII) المعروفة أو حقول البيانات الوصفية الحساسة.
تطبيق خوارزميات إخفاء الهوية المختارة لاستبدال أو إخفاء نقاط البيانات المحددة مع الحفاظ على فائدة البيانات.
تنفيذ إجراءات التحقق للتأكد من عدم بقاء أي معلومات تعريفية في مجموعة البيانات المعالجة.
أرشفة البيانات المحولة بسجلات غير قابلة للتغيير تؤكد الامتثال وتوزيعها على بيئة التدريب الآمنة.
تبدأ المشغلات الآلية عمليات المسح عند تحميل مجموعات بيانات جديدة، وتُعلِّم الملفات التي تحتوي على معلومات تعريف شخصية محتملة للمعالجة الفورية لإخفاء الهوية.
تسمح واجهة الإعدادات للمهندسين باختيار استراتيجيات إخفاء الهوية (مثل الترميز، والتجزئة) بناءً على مستويات حساسية البيانات والمتطلبات التنظيمية.
تعرض لوحات المعلومات في الوقت الفعلي معدلات نجاح إخفاء الهوية، وعدد معلومات التعريف الشخصية (PII) التي تم تمييزها، وسجلات التحقق لأغراض مسارات التدقيق وإعداد تقارير الامتثال.