تجمع قائم على البيانات
يشير التجميع المعتمد على البيانات (Data-Driven Cluster) إلى مجموعة من نقاط البيانات المتشابهة إحصائيًا فيما بينها بناءً على مقاييس أو سمات محددة مسبقًا. على عكس الشرائح المحددة يدويًا، يتم اكتشاف هذه التجمعات تلقائيًا بواسطة الخوارزميات (عادةً تقنيات التعلم الآلي غير الخاضعة للإشراف) التي تحلل مجموعات البيانات الضخمة للعثور على التجمعات الكامنة.
في عالم الأعمال الحديث، البيانات الأولية وفيرة ولكنها غالبًا ما تكون غير منظمة. يحوّل التجميع المعتمد على البيانات هذه الضوضاء إلى ذكاء قابل للتنفيذ. من خلال تجميع الكيانات المتشابهة - سواء كانوا عملاء، أو منتجات، أو معاملات - يمكن للشركات تجاوز الحدس لاتخاذ قرارات تستند إلى الأدلة التجريبية. ويؤدي هذا إلى استهداف أكثر دقة وتخصيص أمثل للموارد.
تتضمن العملية عمومًا عدة مراحل:
يرتبط هذا المفهوم ارتباطًا وثيقًا بتقليل الأبعاد (تبسيط سمات البيانات) والتعلم الخاضع للإشراف (حيث تكون النتائج معروفة ومستخدمة للتدريب، على عكس الطبيعة غير الخاضعة للإشراف للتجميع).