Cụm dữ liệu
Cụm dữ liệu (Data-Driven Cluster) đề cập đến một nhóm các điểm dữ liệu có sự tương đồng về mặt thống kê với nhau dựa trên các chỉ số hoặc đặc trưng được xác định trước. Không giống như các phân khúc được xác định thủ công, các cụm này được thuật toán tự động khám phá (thường là các kỹ thuật học máy không giám sát) bằng cách phân tích các tập dữ liệu lớn để tìm ra các nhóm cố hữu.
Trong kinh doanh hiện đại, dữ liệu thô rất phong phú nhưng thường không có cấu trúc. Phân cụm dựa trên dữ liệu biến sự nhiễu này thành thông tin chi tiết có thể hành động. Bằng cách nhóm các thực thể tương tự—cho dù đó là khách hàng, sản phẩm hay giao dịch—các doanh nghiệp có thể vượt ra ngoài trực giác để đưa ra các quyết định dựa trên bằng chứng thực nghiệm. Điều này dẫn đến việc nhắm mục tiêu chính xác hơn và phân bổ nguồn lực tối ưu.
Quy trình này thường bao gồm một số giai đoạn:
Khái niệm này có liên quan chặt chẽ đến Giảm chiều dữ liệu (Dimensionality Reduction - đơn giản hóa các đặc trưng dữ liệu) và Học có giám sát (Supervised Learning - nơi các kết quả đã biết và được sử dụng để huấn luyện, trái ngược với bản chất không giám sát của phân cụm).