Chỉ số Đa phương thức
Chỉ mục Đa phương thức (Multimodal Index) là một cấu trúc dữ liệu tinh vi được thiết kế để lưu trữ, tổ chức và truy xuất thông tin từ nhiều loại dữ liệu khác nhau cùng một lúc. Không giống như các chỉ mục truyền thống chỉ xử lý văn bản hoặc chỉ xử lý hình ảnh, chỉ mục đa phương thức tích hợp các biểu diễn (embeddings) được tạo ra từ nhiều phương thức—chẳng hạn như văn bản, hình ảnh, âm thanh và video—vào một không gian thống nhất, có thể tìm kiếm được.
Trong môi trường dữ liệu phong phú ngày nay, thông tin hiếm khi bị giới hạn trong một định dạng duy nhất. Các doanh nghiệp cần các hệ thống có thể trả lời các truy vấn phức tạp như: "Hãy cho tôi xem hình ảnh về các phương pháp canh tác bền vững được mô tả trong báo cáo này." Chỉ mục đa phương thức cho phép suy luận đa phương thức này, vượt ra ngoài việc so khớp từ khóa đơn giản để đạt được sự hiểu biết ngữ nghĩa thực sự.
Cơ chế cốt lõi dựa trên các mô hình nhúng (embedding models). Mỗi mẩu dữ liệu (một câu, một bức ảnh, một đoạn âm thanh) được đưa qua một bộ mã hóa chuyên dụng để biến nó thành một vector nhiều chiều, hay còn gọi là embedding. Sau đó, chỉ mục đa phương thức sẽ lưu trữ các vector này. Vì mô hình được huấn luyện để ánh xạ các khái niệm liên quan giữa các phương thức đến các điểm gần nhau trong không gian vector, một embedding truy vấn (ví dụ: từ một câu lệnh văn bản) có thể được sử dụng để tìm các vector khớp gần nhất, bất kể dữ liệu gốc là văn bản hay hình ảnh.
Cơ sở dữ liệu Vector, Embeddings, Tìm kiếm ngữ nghĩa, Mô hình Transformer, Tạo sinh tăng cường truy xuất (RAG)