Tinh chỉnh có giám sát
Tinh chỉnh có giám sát (SFT) là một quy trình quan trọng trong học máy ứng dụng, trong đó một mô hình quy mô lớn đã được huấn luyện trước sẽ được huấn luyện thêm trên một tập dữ liệu nhỏ hơn, chất lượng cao và được gán nhãn, dành riêng cho một nhiệm vụ mục tiêu. Mục tiêu là điều chỉnh kiến thức chung được nhúng trong mô hình cơ sở để xuất sắc trong các yêu cầu chuyên biệt, thuộc một lĩnh vực cụ thể.
Các mô hình đa dụng, mặc dù mạnh mẽ, thường thiếu sự tinh tế cần thiết cho các ứng dụng doanh nghiệp chuyên biệt. SFT thu hẹp khoảng cách này bằng cách đưa chuyên môn của lĩnh vực trực tiếp vào các trọng số của mô hình. Điều này tạo ra các kết quả không chỉ đúng ngữ pháp mà còn chính xác về mặt ngữ cảnh và phù hợp với các quy trình kinh doanh hoặc biệt ngữ ngành cụ thể.
Quá trình bắt đầu với một mô hình nền tảng (ví dụ: một mô hình transformer lớn) đã được huấn luyện trên các tập dữ liệu khổng lồ và đa dạng. Trong SFT, mô hình này sau đó được tiếp xúc với các cặp lời nhắc đầu vào và các đầu ra mong muốn do chuyên gia cung cấp. Mô hình liên tục điều chỉnh các tham số nội bộ của nó để giảm thiểu sự khác biệt giữa các dự đoán của nó và các nhãn sự thật được cung cấp trong tập dữ liệu tinh chỉnh.
SFT được sử dụng rộng rãi trong nhiều chức năng kinh doanh:
Những ưu điểm chính của SFT bao gồm sự gia tăng đáng kể về hiệu suất trên các nhiệm vụ mục tiêu, giảm độ trễ suy luận so với việc đưa ra các hướng dẫn phức tạp cho các mô hình lớn, và cải thiện sự tuân thủ giọng điệu thương hiệu hoặc các ràng buộc quy định.
Các thách thức chính liên quan đến chất lượng và số lượng dữ liệu được gán nhãn. Dữ liệu huấn luyện được tuyển chọn kém hoặc bị thiên vị sẽ dẫn đến một mô hình được tinh chỉnh kém. Hơn nữa, tài nguyên tính toán cần thiết cho chính quá trình tinh chỉnh có thể rất lớn.
Quá trình này có liên quan chặt chẽ đến Học tăng cường từ Phản hồi của Con người (RLHF), vốn thường theo sau SFT để tiếp tục điều chỉnh hành vi của mô hình sau khi tinh chỉnh ban đầu theo nhiệm vụ.