Cơ sở tri thức đa phương thức
Cơ sở Tri thức Đa phương thức (MKB) là một kho lưu trữ dữ liệu tinh vi được thiết kế để lưu trữ, lập chỉ mục và truy xuất thông tin từ nhiều loại dữ liệu cùng một lúc. Không giống như các cơ sở dữ liệu truyền thống chỉ xử lý văn bản có cấu trúc, MKB tích hợp dữ liệu phi cấu trúc như tài liệu văn bản, hình ảnh, bản ghi âm thanh, luồng video và dữ liệu cảm biến vào một cấu trúc thống nhất, có thể tìm kiếm theo ngữ nghĩa.
Trong môi trường dữ liệu phong phú ngày nay, thông tin hiếm khi tồn tại ở một định dạng duy nhất. Một truy vấn của khách hàng có thể bao gồm hình ảnh một bộ phận bị hỏng và bản ghi hỗ trợ liên quan. MKB cho phép các hệ thống AI xử lý bối cảnh toàn diện này, vượt ra ngoài việc so khớp từ khóa đơn giản để đạt được sự hiểu biết theo ngữ cảnh thực sự. Khả năng này rất quan trọng để xây dựng các tác nhân AI thế hệ mới và các công cụ tìm kiếm doanh nghiệp tiên tiến.
Cơ chế cốt lõi dựa trên việc nhúng (embedding). Mỗi mẩu dữ liệu—dù là một đoạn văn bản hay một bức ảnh—đều được đưa qua một bộ mã hóa chuyên dụng (như mô hình transformer đa phương thức) để tạo ra một vector nhiều chiều, được gọi là embedding. Các embedding này nắm bắt ý nghĩa ngữ nghĩa của nội dung. Sau đó, MKB lưu trữ các vector này, thường là trong một cơ sở dữ liệu vector. Việc truy xuất được thực hiện bằng cách tính toán độ tương đồng (ví dụ: độ tương đồng cosine) giữa embedding truy vấn và các embedding dữ liệu đã lưu trữ, cho phép hệ thống tìm thấy các mục có liên quan về mặt khái niệm trên các phương thức khác nhau.
Công nghệ này được xây dựng dựa trên Cơ sở dữ liệu Vector, Mô hình Ngôn ngữ Lớn (LLM) và Tạo sinh Tăng cường Truy xuất (RAG). Trong khi LLM xử lý ngôn ngữ, MKB cung cấp bối cảnh đa phương thức phong phú mà LLM sau đó có thể suy luận.