Memória Multimodal
Memória Multimodal refere-se à capacidade de um sistema de inteligência artificial de armazenar, recuperar e raciocinar sobre informações apresentadas em múltiplos formatos de dados simultaneamente. Diferentemente dos sistemas de memória tradicionais que lidam com tipos de dados singulares (por exemplo, logs de texto ou vetores numéricos), a memória multimodal funde representações de várias modalidades — como texto, imagens, áudio, vídeo e dados de sensores — em uma base de conhecimento unificada e coerente.
Em aplicações modernas e complexas, os dados do mundo real são inerentemente multimodais. Uma consulta do usuário pode envolver uma imagem e texto acompanhante. Uma memória multimodal permite que os agentes de IA mantenham uma compreensão abrangente de todo o contexto, levando a interações significativamente mais nuançadas, precisas e semelhantes às humanas. Isso leva a IA além da simples correspondência de padrões para uma compreensão contextual genuína.
O mecanismo central envolve a incorporação de diferentes tipos de dados em um espaço vetorial compartilhado e de alta dimensão. Cada modalidade (por exemplo, um patch de imagem, um embedding de frase) é processada por um codificador especializado em um vetor. Esses vetores são então alinhados e armazenados juntos em uma estrutura de memória unificada. A recuperação envolve consultar esse espaço usando um prompt que pode conter modalidades mistas, permitindo que o sistema recupere memórias relevantes e referenciadas cruzadamente.
Este conceito se baseia em Bancos de Dados Vetoriais, que armazenam embeddings, e em Modelos de Linguagem Grandes (LLMs), que fornecem a camada de raciocínio. Ele representa a evolução dos LLMs para agentes verdadeiramente multimodais.