Ajuste de Instrução
A Ajuste por Instrução (Instruction Tuning) é uma técnica de ajuste fino aplicada a grandes modelos de linguagem pré-treinados (LLMs). Em vez de treinar o modelo apenas em vastos corpora de texto não estruturado, o ajuste por instrução treina o modelo em um conjunto de dados curado de pares de prompt-resposta. Esses pares demonstram explicitamente comportamentos desejados, como responder a perguntas, resumir textos ou seguir comandos específicos.
O objetivo principal do ajuste por instrução é alinhar o conhecimento geral de um LLM base com as instruções específicas e acionáveis de um usuário humano. Um LLM base pode ser conhecedor, mas sem direção; o ajuste por instrução o transforma em um assistente capaz que executa tarefas de forma confiável, conforme pretendido. Esse alinhamento é crucial para levar os LLMs de curiosidades de pesquisa a ferramentas empresariais confiáveis.
O processo envolve a coleta ou síntese de exemplos de alta qualidade, onde uma entrada (a instrução/o prompt) é pareada com uma saída ideal (a resposta desejada). O modelo é então treinado usando ajuste fino supervisionado (Supervised Fine-Tuning - SFT) nesse conjunto de dados. O modelo aprende o mapeamento entre o formato da instrução e o formato de saída correto, aprendendo efetivamente como seguir as direções, e não apenas quais informações existem.
O ajuste por instrução permite a implementação prática em várias funções de negócios:
Esta técnica está intimamente relacionada ao Aprendizado por Reforço a partir de Feedback Humano (RLHF - Reinforcement Learning from Human Feedback), que frequentemente segue o ajuste por instrução para refinar ainda mais o alinhamento de preferências do modelo após a fase inicial de ajuste supervisionado.