Mô hình hóa chủ đề
Mô hình hóa Chủ đề (Topic Modeling) là một kỹ thuật thống kê được sử dụng để khám phá các 'chủ đề' trừu tượng xuất hiện trong một tập hợp các tài liệu. Đây là một hình thức học máy không giám sát, nghĩa là nó tìm ra các mẫu trong dữ liệu mà không cần được huấn luyện rõ ràng trên các ví dụ được gán nhãn. Thay vì cho mô hình biết chủ đề là gì, bạn cung cấp cho nó một kho văn bản lớn, và mô hình sẽ nhóm các từ thường xuyên xuất hiện cùng nhau thành các cụm chủ đề mạch lạc.
Đối với các doanh nghiệp xử lý lượng lớn văn bản phi cấu trúc—chẳng hạn như đánh giá của khách hàng, phiếu hỗ trợ, bài báo tin tức hoặc nguồn cấp dữ liệu mạng xã hội—Mô hình hóa Chủ đề cung cấp một cách có thể mở rộng để rút ra thông tin chi tiết có thể hành động. Nó vượt ra ngoài việc đếm từ khóa đơn thuần để tiết lộ các chủ đề tiềm ẩn thúc đẩy tâm lý khách hàng, xu hướng thị trường hoặc hiệu suất nội dung, từ đó cho phép các chiến lược nhắm mục tiêu hơn.
Thuật toán phổ biến nhất là Phân bổ Dirichlet Tiềm ẩn (Latent Dirichlet Allocation - LDA). Nói một cách đơn giản, LDA giả định rằng mỗi tài liệu là sự pha trộn của nhiều chủ đề khác nhau, và mỗi chủ đề là một phân phối xác suất trên một tập hợp các từ. Mô hình lặp đi lặp lại để tinh chỉnh các xác suất này. Nó xem xét những từ nào xuất hiện cùng nhau trên nhiều tài liệu. Nếu 'pin,' 'sạc' và 'tuổi thọ' thường xuyên xuất hiện trong cùng các tài liệu, mô hình sẽ gán cho chúng xác suất cao thuộc về một chủ đề tiềm ẩn duy nhất, chẳng hạn như 'Hiệu suất Thiết bị.'
Mô hình hóa Chủ đề có nhiều ứng dụng đa dạng trong doanh nghiệp:
Các khái niệm liên quan bao gồm Phân tích Cảm xúc (Sentiment Analysis - đánh giá cảm xúc liên quan đến một chủ đề), Nhận dạng Thực thể Có tên (Named Entity Recognition - xác định các người hoặc địa điểm cụ thể), và Nhúng Từ (Word Embeddings - biểu diễn các từ dưới dạng các vector dày đặc trong không gian toán học).