Présentation du front-end
Le frontend d’IA pour l’IA englobe l’interface, les outils et les méthodes qui permettent aux utilisateurs d’interagir avec les systèmes d’IA, ainsi que l’infrastructure qui permet ces interactions. Le Frontend donne aux utilisateurs la possibilité de lancer des tâches d’entraînement ou d’inférence, et de visualiser les résultats, tout en masquant les complexités techniques sous-jacentes.
Les composants clés des systèmes Frontend comprennent :
- Planification de modèles : outils et méthodes de gestion des tâches de modèles d’IA scriptés, généralement basés sur le gestionnaire de charges de travail SLURM (Simple Linux Utility for Resource Management). Ces outils permettent aux utilisateurs d’envoyer des instructions, des commandes et des requêtes, soit via un shell CLI, soit via une interface Web graphique pour orchestrer tâches d’apprentissage et d’inférence exécutées sur les GPU. Les utilisateurs peuvent configurer les paramètres du modèle, saisir des données et interpréter les résultats, ainsi que lancer ou terminer des tâches de manière interactive. Dans la JVD IA, ces outils sont hébergés sur les serveurs principaux connectés à la fabric front-end de l’IA.
- Gestion des systèmes d’IA : Outils de gestion (configuration, surveillance et exécution des tâches de maintenance) des composants de stockage et de traitement de l’IA. Ces outils facilitent la création, l’exécution, l’entraînement et l’utilisation efficace des modèles d’IA. SLURM, TensorFlow, PyTorch et Scikit-learn en sont des exemples.
- Gestion des composants fabric : mécanismes et workflows conçus pour aider les utilisateurs à déployer et à gérer sans effort les équipements de la fabric en fonction de leurs besoins et de leurs objectifs. Il comprend des tâches telles que l’intégration des appareils, la gestion de la configuration et l’orchestration du déploiement de la fabric. Cette fonctionnalité est fournie par Juniper Apstra .
- Surveillance des performances et analyse des erreurs : systèmes de télémétrie qui suivent les métriques de performance clés liées aux modèles d’IA, telles que l’exactitude, la précision, le rappel et l’utilisation des ressources de calcul (par exemple, l’utilisation du CPU, du GPU), qui sont essentielles pour évaluer l’efficacité du modèle pendant les tâches d’entraînement et d’inférence. Ces systèmes fournissent également des informations sur les taux d’erreur et les schémas d’échec pendant les opérations d’entraînement et d’inférence, et aident à identifier les problèmes tels que la dérive du modèle, les problèmes de qualité des données ou les erreurs algorithmiques qui peuvent affecter les performances de l’IA. Parmi ces systèmes, citons les tableaux de bord Juniper Apstra, TIG Stack et Elasticsearch.
- Visualisation des données : applications et outils qui permettent aux utilisateurs de comprendre visuellement les informations générées par les modèles et les charges de travail d’IA. Ils fournissent une visualisation efficace qui améliore la compréhension et la prise de décision en fonction des résultats de l’IA. Les mêmes systèmes de télémétrie utilisés pour surveiller et mesurer les performances au niveau du système et du réseau fournissent généralement cette visualisation également. Parmi ces outils, citons les tableaux de bord Juniper Apstra, TensorFlow et la pile TIG.
- Interface utilisateur : infrastructure de routage et de commutation qui permet la communication entre l’interface utilisateur, les applications et les outils et les systèmes d’IA exécutant les tâches, y compris les GPU et les périphériques de stockage. Cette infrastructure garantit une interaction transparente entre les utilisateurs et les ressources de calcul nécessaires pour exploiter efficacement les capacités de l’IA.
- Contrôle GPU à GPU : établissement de la communication, échange d’informations, y compris les GID QP (ID globaux), les adresses tampons locales et distantes, et les clés RDMA (RKEYS pour les autorisations d’accès à la mémoire)