Truyền phát Token
Truyền phát token (Token streaming) là một phương pháp cung cấp đầu ra từ Mô hình Ngôn ngữ Lớn (LLM) cho người dùng cuối hoặc ứng dụng khách một cách tăng dần, khi các token riêng lẻ được tạo ra, thay vì chờ toàn bộ phản hồi được tính toán xong và trả về trong một khối duy nhất.
Thay vì có độ trễ dài trong khi mô hình xử lý toàn bộ lời nhắc, hệ thống sẽ gửi lại các đoạn văn bản nhỏ (token) ngay lập tức. Điều này tạo ra cảm giác phản hồi tức thời, ngay cả khi tổng thời gian tạo vẫn giữ nguyên.
Đối với các ứng dụng AI hiện đại, độ trễ là một yếu tố quan trọng quyết định sự hài lòng của người dùng. Các lệnh gọi API theo kiểu lô truyền thống buộc người dùng phải nhìn chằm chằm vào biểu tượng tải cho đến khi từ cuối cùng xuất hiện. Truyền phát token thay đổi cơ bản mô hình tương tác này.
Nó cải thiện đáng kể hiệu suất cảm nhận của ứng dụng. Người dùng có thể bắt đầu đọc và tương tác với nội dung gần như ngay lập tức, dẫn đến Trải nghiệm Khách hàng (CX) tốt hơn đáng kể và tỷ lệ tương tác cao hơn.
Khi một ứng dụng sử dụng truyền phát token, nó thiết lập một kết nối hai chiều, bền vững với điểm cuối LLM, thường sử dụng các giao thức như Server-Sent Events (SSE) hoặc WebSockets.
Truyền phát token là nền tảng cho một số tính năng AI giá trị cao:
Những ưu điểm của việc triển khai truyền phát token là rõ ràng và có thể đo lường được:
Mặc dù có lợi, việc truyền phát mang lại sự phức tạp:
Truyền phát token có liên quan chặt chẽ đến lập trình bất đồng bộ, các mẫu thiết kế API (như SSE) và cơ chế cơ bản của các mô hình transformer. Nó là một cơ chế phân phối được xây dựng dựa trên khả năng tạo token của LLM.