Modèle local
Un modèle local fait référence à un modèle d'intelligence artificielle — tel qu'un petit modèle de langage (SLM) ou un modèle de vision spécialisé — conçu et optimisé pour fonctionner entièrement sur le matériel de l'utilisateur final, tel qu'un smartphone, un ordinateur portable ou un appareil périphérique (edge device). Contrairement aux modèles basés sur le cloud qui nécessitent une connectivité Internet constante et une communication avec des serveurs distants, les modèles locaux exécutent l'inférence directement sur le CPU, le GPU ou les unités de traitement neuronal (NPU) spécialisées de l'appareil.
Le passage aux modèles locaux répond à des besoins critiques des entreprises en matière de gouvernance des données, de latence et de résilience opérationnelle. Pour les entreprises traitant des données sensibles (par exemple, les soins de santé, la finance), le maintien des données sur l'appareil élimine le risque associé à la transmission d'informations propriétaires à des serveurs cloud tiers. De plus, l'élimination de la dépendance au réseau garantit des performances constantes même dans des environnements à faible connectivité.
Le déploiement de modèles locaux repose fortement sur les techniques de quantification et d'élagage (pruning) des modèles. Ces méthodes d'optimisation réduisent la taille et les exigences de calcul du modèle sans sacrifier drastiquement la précision. Des frameworks comme TensorFlow Lite ou ONNX Runtime permettent aux développeurs de compiler de grands modèles pré-entraînés en versions légères et très efficaces, adaptées aux environnements matériels contraints. Les poids du modèle sont intégrés dans l'application elle-même, permettant un fonctionnement autonome.