التعرف على الكيانات المسماة
التعرف على الكيانات المسماة (NER) هو مهمة فرعية من استخراج المعلومات تهدف إلى تحديد وتصنيف الكيانات المسماة المذكورة في النصوص غير المهيكلة ضمن فئات محددة مسبقًا مثل أسماء الأشخاص، والمؤسسات، والمواقع، والتواريخ، والقيم النقدية، والنسب المئوية.
يحوّل NER النص الخام وغير المهيكل - مثل المقالات الإخبارية، أو مراجعات العملاء، أو المستندات القانونية - إلى نقاط بيانات مهيكلة وقابلة للقراءة آليًا. هذا المخرج المهيكل بالغ الأهمية للعمليات التحليلية اللاحقة.
في عصر البيانات الضخمة، تكمن كميات هائلة من المعلومات القيمة محبوسة داخل النصوص الحرة. يوفر NER الآلية لإطلاق هذه القيمة. بالنسبة للشركات، يعني هذا تجاوز عمليات البحث البسيطة عن الكلمات المفتاحية إلى فهم السياق والجهات الفاعلة المحددة داخل المستند حقًا.
يتيح التعرف الدقيق على الكيانات المسماة للأنظمة أتمتة إدخال البيانات، وتحسين مدى صلة البحث، وتزويد أدوات ذكاء الأعمال المتطورة دون الحاجة إلى مراجعة يدوية لكل مستند.
عادةً ما يتم بناء نماذج NER باستخدام تقنيات معالجة اللغة الطبيعية (NLP)، وغالبًا ما تستفيد من معماريات التعلم العميق مثل الشبكات العصبية المتكررة (RNNs) أو المحولات (Transformers).
يتم نشر NER عبر العديد من التطبيقات الصناعية:
تشمل الفوائد الأساسية لتطبيق NER ما يلي:
على الرغم من قوته، يواجه NER العديد من العقبات:
يرتبط NER ارتباطًا وثيقًا بمهام معالجة اللغة الطبيعية الأخرى. يربط ربط الكيانات (Entity Linking) الكيان المعترف به (مثل "IBM") بإدخال محدد في قاعدة معرفية (مثل Wikidata). يذهب استخراج العلاقات (Relation Extraction) خطوة أبعد من خلال تحديد العلاقة بين كيانين معترف بهما (مثل "الرئيس التنفيذي لـ IBM").