Thích ứng hạng thấp
Low-Rank Adaptation (LoRA) là một kỹ thuật Tinh chỉnh Hiệu quả Tham số (PEFT) được thiết kế để điều chỉnh các mô hình được huấn luyện trước quy mô lớn, chẳng hạn như Mô hình Ngôn ngữ Lớn (LLM), cho các tác vụ cụ thể mà không cần huấn luyện lại tất cả các tham số gốc của mô hình. Thay vì cập nhật toàn bộ ma trận trọng số khổng lồ, LoRA chèn các ma trận phân rã hạng nhỏ, có thể huấn luyện được vào các lớp của mô hình.
Việc tinh chỉnh truyền thống đòi hỏi nguồn tài nguyên tính toán đáng kể, bao gồm lượng lớn bộ nhớ GPU và thời gian, đặc biệt khi xử lý các mô hình chứa hàng tỷ tham số. LoRA giảm đáng kể yêu cầu này. Bằng cách chỉ huấn luyện một phần rất nhỏ các ma trận hạng thấp mới, nó giúp việc tùy chỉnh mô hình tiên tiến trở nên dễ tiếp cận đối với các nhà nghiên cứu và doanh nghiệp có phần cứng hạn chế.
Về cốt lõi, LoRA xấp xỉ sự cập nhật của một ma trận trọng số lớn, $\Delta W$, bằng tích của hai ma trận nhỏ hơn nhiều, $A$ và $B$. Về mặt toán học, $\Delta W \approx BA$, trong đó hạng ($r$) của phép phân rã nhỏ hơn đáng kể so với kích thước ma trận ban đầu. Trong quá trình huấn luyện, chỉ các tham số trong các ma trận $A$ và $B$ được cập nhật, trong khi các trọng số được huấn luyện trước ban đầu, bị đóng băng ($W_0$) vẫn giữ nguyên. Đầu ra cuối cùng được tính bằng cách cộng sự thay đổi đã được điều chỉnh vào trọng số gốc: $W' = W_0 + BA$.
LoRA được áp dụng rộng rãi trong nhiều ứng dụng AI khác nhau:
Những ưu điểm của việc áp dụng LoRA là rất đáng kể đối với các quy trình MLOps:
Mặc dù rất hiệu quả, LoRA không phải là không có hạn chế. Việc lựa chọn hạng ($r$) là một siêu tham số quan trọng; đặt nó quá thấp có thể dẫn đến thiếu khớp (underfit) tác vụ, trong khi đặt nó quá cao làm giảm lợi ích về hiệu quả tham số. Hơn nữa, mặc dù nó thích ứng tốt với kiến thức cụ thể của tác vụ, nó không thay đổi cơ bản kiến thức thế giới cốt lõi của mô hình được nhúng trong các trọng số bị đóng băng.
Kỹ thuật này là một phần của lĩnh vực rộng lớn hơn là Tinh chỉnh Hiệu quả Tham số (PEFT). Các khái niệm liên quan khác bao gồm Prompt Tuning, Prefix Tuning và Quantization, tất cả đều nhằm mục đích giảm chi phí tính toán khi điều chỉnh các mô hình nền tảng khổng lồ.