Tối ưu hóa chi phí suy luận và độ trễ bằng cách lưu trữ các phản hồi LLM lặp lại trong một lớp bộ nhớ đệm chuyên dụng, đảm bảo truy xuất nhanh chóng cho các lời nhắc giống hệt trong khi giảm tải tính toán cho máy chủ mô hình chính.

Ưu tiên
Bộ nhớ đệm LLM là một cơ chế lưu trữ quan trọng trong Cơ sở hạ tầng LLM, được thiết kế để giảm thiểu chi phí suy luận cao và độ trễ biến đổi. Bằng cách chặn các yêu cầu và so sánh chúng với các phản hồi đã lưu, hệ thống sẽ phục vụ các lời nhắc giống hệt nhau ngay lập tức từ bộ nhớ hoặc bộ lưu trữ đối tượng thay vì kích hoạt các phép tính mô hình tốn kém. Chức năng này tập trung cụ thể vào việc phát hiện và truy xuất sự trùng lặp phản hồi, đảm bảo rằng các ứng dụng doanh nghiệp duy trì hiệu suất ổn định mà không tạo ra các điểm dữ liệu mới trong vòng đời của bộ nhớ đệm.
Hệ thống bắt đầu tra cứu bộ nhớ đệm bằng cách băm lời nhắc đầu vào và cửa sổ ngữ cảnh để tạo ra một mã nhận dạng duy nhất cho việc truy xuất lưu trữ tiềm năng.
Khi tìm thấy kết quả khớp trong lớp lưu trữ, phản hồi được lưu trong bộ nhớ đệm sẽ được trả về ngay lập tức, bỏ qua hoàn toàn bộ máy suy luận mạng nơ-ron.
Nếu không tìm thấy kết quả phù hợp, yêu cầu sẽ được chuyển đến mô hình chính để tạo ra, và đầu ra mới này sau đó sẽ được lưu trữ cho các truy vấn giống hệt trong tương lai.
Phân tích tải trọng yêu cầu đến và trích xuất nội dung ngữ nghĩa để băm
Truy vấn lớp lưu trữ bằng mã định danh băm đã tạo
Truy xuất phản hồi đã lưu nếu tìm thấy kết quả khớp hợp lệ trong cửa sổ TTL
Phục vụ dữ liệu được lưu trong bộ nhớ đệm hoặc chuyển tiếp yêu cầu đến máy chủ mô hình để tạo mới
Tạo các định danh xác định từ văn bản đầu vào để cho phép tra cứu chính xác trong hệ thống lưu trữ phân tán.
Xác minh độ mới và tính toàn vẹn của bộ nhớ đệm trước khi phục vụ các kết quả đã lưu để đảm bảo tính chính xác của dữ liệu cho các ứng dụng hạ nguồn.
Các tuyến đường khớp yêu cầu trực tiếp đến các điểm cuối lưu trữ, giúp tách rời quy trình làm việc khỏi việc thực thi mô hình tốn nhiều tài nguyên tính toán.