Cụm đa phương thức
Cụm đa phương thức (Multimodal Cluster) đề cập đến một nhóm các điểm dữ liệu được xác định bởi một hệ thống AI thể hiện sự tương đồng ngữ nghĩa trên nhiều phương thức dữ liệu riêng biệt. Thay vì chỉ phân cụm dựa trên các nhúng văn bản hoặc các pixel hình ảnh, các cụm này tích hợp thông tin từ nhiều nguồn khác nhau—chẳng hạn như mô tả văn bản, hình ảnh liên quan, bản ghi âm thanh và dữ liệu cảm biến—để tạo thành một biểu diễn toàn diện của dữ liệu.
Các phương pháp phân cụm truyền thống thường thất bại khi dữ liệu vốn dĩ phức tạp và không đồng nhất. Bằng cách sử dụng phân cụm đa phương thức, các doanh nghiệp có thể đạt được sự hiểu biết phong phú hơn nhiều về các tập dữ liệu của họ. Điều này cho phép xác định các mẫu hình tinh tế mà sẽ không thể nhìn thấy khi phân tích các phương thức một cách riêng lẻ, dẫn đến những hiểu biết chính xác hơn và việc ra quyết định tốt hơn.
Quy trình này thường bao gồm một số bước phức tạp. Đầu tiên, mỗi phương thức (ví dụ: văn bản, hình ảnh) được xử lý bởi một bộ mã hóa chuyên dụng (như BERT cho văn bản hoặc ResNet cho hình ảnh) để chuyển nó thành một vector nhúng nhiều chiều cao. Sau đó, các nhúng riêng lẻ này được căn chỉnh vào một không gian nhúng chung, chung. Cuối cùng, các thuật toán phân cụm tiêu chuẩn (như K-Means hoặc DBSCAN) được áp dụng cho các vector đa phương thức hợp nhất này để tạo thành các cụm cuối cùng.