Trình truy xuất sinh
Bộ truy xuất sinh (Generative Retriever) là một thành phần tiên tiến trong các kiến trúc Tạo sinh Tăng cường Truy xuất (RAG). Nó vượt xa việc đối sánh từ khóa đơn giản bằng cách thông minh truy xuất các tài liệu hoặc đoạn dữ liệu có ngữ cảnh phong phú và liên quan nhất từ một cơ sở tri thức lớn để cung cấp cho Mô hình Ngôn ngữ Lớn (LLM). Khía cạnh 'sinh' ngụ ý rằng chính quá trình truy xuất, hoặc sự tích hợp tiếp theo, được thiết kế để tạo ra ngữ cảnh tổng hợp chất lượng cao thay vì chỉ là các tham chiếu thô.
Các LLM truyền thống bị giới hạn bởi dữ liệu mà chúng được huấn luyện, dẫn đến việc cắt giảm kiến thức và khả năng bịa đặt (hallucinations). Bộ truy xuất sinh giải quyết vấn đề này bằng cách neo LLM vào thông tin độc quyền, cập nhật hoặc chuyên biệt theo lĩnh vực. Việc neo này đảm bảo rằng đầu ra của LLM là chính xác, có thể kiểm chứng và liên quan trực tiếp đến truy vấn của người dùng, giúp tăng đáng kể độ tin cậy và độ chính xác trong các triển khai AI doanh nghiệp.
Quy trình này thường bao gồm nhiều giai đoạn:
Công nghệ này gắn liền với Tạo sinh Tăng cường Truy xuất (RAG), Cơ sở dữ liệu Vector, Tìm kiếm Ngữ nghĩa và tích hợp Đồ thị Tri thức.