Tinh chỉnh hướng dẫn
Tinh chỉnh theo hướng dẫn (Instruction Tuning) là một kỹ thuật tinh chỉnh được áp dụng cho các mô hình ngôn ngữ lớn (LLM) đã được huấn luyện trước. Thay vì chỉ huấn luyện mô hình trên các tập dữ liệu văn bản khổng lồ, phi cấu trúc, tinh chỉnh theo hướng dẫn huấn luyện mô hình trên một tập dữ liệu được tuyển chọn gồm các cặp câu lệnh-phản hồi. Những cặp này thể hiện rõ ràng các hành vi mong muốn, chẳng hạn như trả lời câu hỏi, tóm tắt văn bản hoặc tuân theo các lệnh cụ thể.
Mục tiêu chính của tinh chỉnh theo hướng dẫn là căn chỉnh kiến thức tổng quát của một LLM cơ sở với các hướng dẫn cụ thể, có thể hành động của người dùng. Một LLM cơ sở có thể am hiểu nhưng không được định hướng; tinh chỉnh theo hướng dẫn biến nó thành một trợ lý có năng lực, có khả năng thực hiện các tác vụ một cách đáng tin cậy như dự định. Sự căn chỉnh này rất quan trọng để đưa LLM từ những điều tò mò trong nghiên cứu trở thành các công cụ doanh nghiệp đáng tin cậy.
Quá trình này bao gồm việc thu thập hoặc tổng hợp các ví dụ chất lượng cao, trong đó một đầu vào (câu lệnh/prompt) được ghép nối với một đầu ra lý tưởng (phản hồi mong muốn). Sau đó, mô hình được huấn luyện bằng phương pháp tinh chỉnh có giám sát (SFT) trên tập dữ liệu này. Mô hình học cách ánh xạ giữa định dạng câu lệnh và định dạng đầu ra chính xác, về cơ bản là học cách làm theo chỉ dẫn, chứ không chỉ là thông tin nào tồn tại.
Tinh chỉnh theo hướng dẫn cho phép triển khai thực tế trên nhiều chức năng kinh doanh khác nhau:
Kỹ thuật này có liên quan chặt chẽ đến Học tăng cường từ Phản hồi của Con người (RLHF), vốn thường theo sau tinh chỉnh theo hướng dẫn để tinh chỉnh hơn nữa sự căn chỉnh sở thích của mô hình sau giai đoạn tinh chỉnh có giám sát ban đầu.