Moteur local
Un Moteur Local (Local Engine) désigne un cadre de calcul ou un module logiciel conçu pour exécuter des processus complexes, tels que l'inférence d'apprentissage automatique, le traitement de données ou la logique applicative, directement sur l'appareil de l'utilisateur final (par exemple, smartphone, ordinateur portable, appareil IoT) au lieu de dépendre uniquement d'un serveur cloud distant.
Ceci contraste fortement avec les architectures traditionnelles basées sur le cloud où tout le travail lourd est effectué dans des centres de données centralisés.
Le passage aux moteurs locaux est motivé par des besoins critiques en matière de latence réduite, de confidentialité accrue de l'utilisateur et de résilience opérationnelle. Lorsque le traitement s'effectue localement, l'application devient moins dépendante d'une connectivité Internet constante et rapide.
Pour les applications métier, cela se traduit directement par une meilleure expérience utilisateur (UX) et la capacité de déployer des fonctionnalités critiques dans des environnements à faible connectivité.
Les moteurs locaux exploitent généralement des modèles optimisés et légers (souvent des versions quantifiées ou élaguées de modèles cloud plus volumineux) qui sont compilés pour fonctionner efficacement sur le matériel spécifique de l'appareil (CPU, GPU ou unités de traitement neuronal spécialisées - NPU).
Le flux de travail comprend : la conversion du modèle pour le déploiement en périphérie (edge), l'ingestion de données locales, l'exécution de l'inférence en temps réel et la présentation des résultats localement.
Informatique en périphérie (Edge Computing), TinyML, Apprentissage fédéré (Federated Learning), Inférence sur appareil (On-Device Inference)