Tìm kiếm đa phương thức
Tìm kiếm đa phương thức (Multimodal Search) đề cập đến một khả năng tìm kiếm tinh vi cho phép người dùng nhập và truy vấn thông tin bằng nhiều loại dữ liệu cùng một lúc. Thay vì chỉ giới hạn ở các chuỗi văn bản, các hệ thống này có thể xử lý và hiểu các đầu vào như hình ảnh, đoạn âm thanh, khung hình video và văn bản đồng thời để cung cấp các kết quả có mức độ liên quan cao.
Trong bối cảnh kỹ thuật số hiện đại, ý định của người dùng hiếm khi chỉ là một. Người dùng thường duyệt qua bằng hình ảnh hoặc mô tả các khái niệm bằng lời nói. Tìm kiếm đa phương thức thu hẹp khoảng cách này, vượt ra ngoài việc đối sánh từ khóa để đạt được sự hiểu biết ngữ nghĩa thực sự. Khả năng này rất quan trọng để cải thiện sự tương tác của người dùng, giảm ma sát trong quá trình khám phá và khai thác những hiểu biết sâu sắc hơn từ các tập dữ liệu phức tạp, đa dạng.
Về cốt lõi, tìm kiếm đa phương thức dựa vào các mô hình Học máy (Machine Learning) tiên tiến, thường là các mô hình nền tảng (foundation models) lớn. Các mô hình này được huấn luyện trên các tập dữ liệu khổng lồ ghép nối các phương thức khác nhau (ví dụ: một hình ảnh được ghép với chú thích mô tả của nó). Hệ thống học một không gian nhúng (embedding space) chung, nhiều chiều, nơi các khái niệm từ các định dạng khác nhau—một bức ảnh về con chó và từ 'canine'—được đặt gần nhau. Khi một truy vấn đến, hệ thống sẽ chuyển đổi đầu vào (dù là hình ảnh hay văn bản) thành biểu diễn vector chung này và tìm kiếm trong cơ sở dữ liệu các kết quả khớp gần nhất.
Tìm kiếm ngữ nghĩa (Semantic Search), Cơ sở dữ liệu vector (Vector Databases), AI tạo sinh (Generative AI), Thị giác máy tính (Computer Vision), Xử lý ngôn ngữ tự nhiên (NLP)