Inferência em Lote
Inferência em lote refere-se ao processo de executar um modelo de aprendizado de máquina contra um grande conjunto de dados de entrada estático de uma só vez, em vez de processar pontos de dados individuais sequencialmente em tempo real. Em vez de responder instantaneamente a uma única solicitação do usuário, o sistema processa um 'lote' — uma coleção de dados — e entrega os resultados juntos mais tarde.
Para muitas aplicações de negócios, respostas imediatas e em tempo real não são necessárias. A inferência em lote é fundamental para otimizar recursos computacionais e reduzir custos operacionais quando o alto volume em grandes conjuntos de dados é o objetivo principal. Ela muda o foco do serviço de baixa latência para o processamento de alto volume.
O fluxo de trabalho começa com a agregação do conjunto de dados de destino. Esses dados são então alimentados na infraestrutura do modelo de ML implantado. O modelo processa todas as entradas em paralelo ou em blocos otimizados, aproveitando eficiências de hardware como o paralelismo de GPU. Assim que o cálculo é concluído, as previsões resultantes são emitidas, muitas vezes armazenadas em um banco de dados ou entregues por meio de um trabalho agendado.
Vários cenários empresariais se beneficiam significativamente da inferência em lote. Estes incluem varreduras noturnas de detecção de fraudes em milhões de transações, geração de pontuações de risco de evasão de clientes mensais ou realização de marcação de imagens e moderação de conteúdo em grande escala em mídias carregadas.
As principais vantagens são a eficiência de custos e o volume de processamento. Ao agrupar solicitações, a utilização da infraestrutura é maximizada, levando a custos por previsão mais baixos em comparação com a manutenção de endpoints de serviço sempre ativos e de baixa latência para cada ponto de dados individual.
A principal troca é a latência. Como os dados são processados em blocos, os resultados não são instantâneos. Além disso, gerenciar o pipeline de dados — garantindo que o lote de entrada esteja corretamente preparado e que a saída seja armazenada de forma confiável — adiciona complexidade ao ciclo de vida do MLOps.
A inferência em lote contrasta fortemente com a inferência online (ou inferência em tempo real), onde as previsões devem ser retornadas em milissegundos para interação imediata do usuário. Está intimamente relacionada aos processos ETL (Extrair, Transformar, Carregar) quando usada para enriquecimento de dados.