Destilação de Modelo
Destilação de Modelo é uma técnica de compressão de modelos na qual um modelo grande e de alto desempenho (o modelo 'Professor') é usado para treinar um modelo menor e mais simples (o modelo 'Aluno'). Em vez de treinar o modelo Aluno apenas com os rótulos verdadeiros, ele também é treinado para imitar as probabilidades de saída (os 'alvos suaves') geradas pelo modelo Professor.
Na IA moderna, os modelos de ponta são frequentemente maciços, exigindo recursos computacionais significativos (alta latência, grande pegada de memória). Isso torna a implantação desafiadora em dispositivos com recursos limitados, como telefones celulares, sensores IoT ou em ambientes de computação de borda em tempo real. A destilação permite que as organizações mantenham grande parte do conhecimento complexo do Professor, ao mesmo tempo que reduzem drasticamente o tamanho e o tempo de inferência do Aluno.
O mecanismo central envolve a transferência de 'conhecimento oculto' (dark knowledge). O modelo Professor produz não apenas uma previsão rígida (por exemplo, 'Gato'), mas uma distribuição de probabilidade sobre todas as classes possíveis (por exemplo, 90% Gato, 8% Cachorro, 2% Pássaro). Essa distribuição contém informações sutis sobre a incerteza do modelo e as relações entre as classes. O modelo Aluno é então treinado usando uma função de perda combinada: um componente minimiza a diferença entre suas previsões e os rótulos verdadeiros (alvos rígidos), e um segundo componente minimiza a diferença entre suas previsões e os alvos suaves do Professor.