Ajuste Fino Supervisionado
A Afinação Supervisionada (SFT - Supervised Fine-Tuning) é um processo crítico em aprendizado de máquina aplicado, no qual um modelo pré-treinado e de grande escala é treinado adicionalmente em um conjunto de dados menor, de alta qualidade e rotulado, específico para uma tarefa alvo. O objetivo é adaptar o conhecimento geral incorporado no modelo base para que ele se destaque em requisitos de nicho e específicos de domínio.
Modelos de propósito geral, embora poderosos, muitas vezes carecem da nuance necessária para aplicações empresariais especializadas. O SFT preenche essa lacuna injetando a experiência de domínio diretamente nos pesos do modelo. Isso resulta em saídas que não são apenas gramaticalmente corretas, mas também contextualmente precisas e alinhadas com protocolos de negócios específicos ou jargões da indústria.
O processo começa com um modelo fundamental (por exemplo, um grande modelo transformer) que já foi treinado em conjuntos de dados massivos e diversos. No SFT, este modelo é então exposto a pares de prompts de entrada e saídas desejadas, fornecidas por especialistas. O modelo ajusta iterativamente seus parâmetros internos para minimizar a diferença entre suas previsões e os rótulos verdadeiros fornecidos no conjunto de dados de afinação.
O SFT é amplamente utilizado em várias funções de negócios:
As principais vantagens do SFT incluem ganhos significativos de desempenho em tarefas alvo, redução da latência de inferência em comparação com a solicitação de modelos massivos com instruções complexas, e melhor aderência à voz da marca ou restrições regulatórias.
Os principais desafios envolvem a qualidade e a quantidade dos dados rotulados. Dados de treinamento mal curados ou tendenciosos levarão a um modelo mal afinado. Além disso, os recursos computacionais necessários para o próprio processo de afinação podem ser substanciais.
Este processo está intimamente relacionado ao Aprendizado por Reforço a partir de Feedback Humano (RLHF - Reinforcement Learning from Human Feedback), que frequentemente segue o SFT para alinhar ainda mais o comportamento do modelo após o ajuste inicial específico da tarefa.