Orçamento de Tokens
No contexto de Modelos de Linguagem Grandes (LLMs) e IA generativa, o Orçamento de Tokens refere-se ao número máximo de tokens que um aplicativo ou usuário tem permissão para processar dentro de uma interação, chamada de API ou período de uso específico. Tokens são as unidades fundamentais de texto que os LLMs usam para processar informações; eles podem representar palavras, subpalavras ou caracteres.
Este orçamento dita o tamanho total da entrada (prompt) e o tamanho total da saída (completude) que o modelo pode lidar simultaneamente, impactando diretamente a latência e o custo operacional.
Gerenciar o Orçamento de Tokens é fundamental por várias razões de negócios:
O processo de tokenização divide o texto bruto em tokens discretos. Por exemplo, a palavra 'tokenização' pode ser dividida em vários tokens. O Orçamento de Tokens é geralmente definido pelo tamanho da janela de contexto do modelo (por exemplo, 4096 tokens). Esta janela deve acomodar tanto o prompt de entrada quanto a resposta de saída esperada.
Se o seu prompt consumir 3000 tokens e a janela de contexto máxima do modelo for de 4096 tokens, seu orçamento restante para a resposta é de apenas 1096 tokens.