SUR CETTE PAGE
Mode de sécurité intégrée du contrôleur NorthStar
La base de données Cassandra est un élément clé du fonctionnement du contrôleur NorthStar, avec ou sans HA. La perte de connectivité à la base de données Cassandra entraîne une interruption de service pour les utilisateurs de l’interface NorthStar Northbound, car l’interface utilisateur Web et l’API REST deviennent indisponibles. Dans ce cas, NorthStar entre en mode de sécurité intégrée qui permet aux utilisateurs de conserver la visibilité du réseau via NorthStar et active les fonctions de base de NorthStar jusqu’à ce que le problème de base de données Cassandra puisse être corrigé.
Apache Cassandra étant un logiciel open source, les stratégies de dépannage Cassandra sont bien documentées ailleurs. Voici quelques exemples de sites Web :
-
Principal : Documentation Cassandra
-
Supplémentaire : Cassandra Wiki
-
DataStax Entreprise
Dans le cas d’une simple perte de connectivité à la base de données Cassandra, les processus NorthStar sont toujours en cours d’exécution et il n’y a aucune interruption de service pour les LSP contrôlés par NorthStar ou pour les LSP nouvellement délégués créés sur les routeurs. Toutefois, lorsque vous tentez d’accéder à l’interface utilisateur Web de NorthStar, un message d’erreur tel que :
{"error":"All host(s) tried for query failed. First host tried, 172.25.152.169:9042: Host considered as DOWN. See innerErrors."}
Lorsque cette erreur est détectée par le serveur Web (nodejs), il passe en mode de sécurité intégrée afin que les utilisateurs puissent avoir un accès en lecture seule.
La perte de connectivité avec Cassandra peut être aggravée par le redémarrage des processus pour tenter de résoudre le problème. Redémarrer les processus NorthStar peut sembler être une étape de dépannage naturelle lorsque vous ne pouvez pas accéder à l’interface utilisateur Web ou à l’API REST. Mais si l’interface utilisateur Web et l’API REST ne sont pas disponibles parce que la connectivité à Cassandra a été perdue, le redémarrage de Toposerver et le serveur Web ne peuvent pas réussir. Cela entraîne des interruptions de service pour les LSP contrôlés par NorthStar. De plus, le redémarrage des processus NorthStar ne corrige pas le problème de connectivité de Cassandra.
Dans ce cas, le serveur Web et Toposerver passent en mode de sécurité intégrée, offrant un accès en lecture seule. Toposerver charge la topologie du réseau à partir du dernier instantané réseau enregistré dans le système de fichiers.
Fonctionnalité en mode sans faille
Le déclencheur du mode sans faille est que la base de données Cassandra n’est pas disponible. En l’absence de Cassandra, le mode sans faille ne peut pas émuler toutes les fonctionnalités de NorthStar, mais il offre les avantages suivants :
-
Le serveur PCEP et le serveur PCS (Path Computation Server) restent en cours d’exécution. Le serveur web (nodejs), Toposerver et task_scheduler restent en cours d’exécution, mais en mode de sécurité intégrée.
-
Même si la base de données Cassandra a été corrompue, le mode de sécurité fonctionne.
-
Même si un seul serveur d’un cluster NorthStar est opérationnel, le mode sans faille fonctionne.
-
Une page d’accueil en mode sécurité est fournie dans l’interface utilisateur Web de NorthStar. Une connexion d’administrateur est requise pour accéder à la page d’accueil. La figure 1 montre la page d’accueil du mode sans faille. Notez le changement de couleur de la barre de menu supérieure et la notation (Safe Mode), dans le coin supérieur droit.
Figure 1 : page
d’accueil du mode sans échec
-
En mode de sécurité intégrée, les LSP délégués existants ou initiés par le PCE peuvent être réacheminés par le PCS en cas de panne réseau.
-
Toposerver n’utilise pas la base de données Cassandra pour charger le modèle réseau. Au lieu de cela, il charge le modèle de réseau en fonction du dernier instantané réseau collecté par le système de fichiers NorthStar. Pendant le fonctionnement normal de NorthStar, le système de fichiers collecte et stocke les instantanés du réseau toutes les heures (par défaut).
-
Si HA basculement se produit alors que Cassandra est inaccessible, l’agent HA peut toujours choisir un nœud actif en mode de sécurité intégrée. Les processus NorthStar du nouveau nœud actif démarrent en mode sécurité lorsqu’ils découvrent que Cassandra n’est pas disponible.
-
En mode de sécurité intégrée, l’état du cluster NorthStar est affiché pour tous les utilisateurs via une bannière dans l’interface utilisateur Web. La fonction de rapport d’intégrité NorthStar signale également l’état des nœuds, même lorsqu’ils sont en panne.
Limites du mode sans faille
Le mode de sécurité intégrée est destiné à une utilisation temporaire jusqu’à ce que la base de données Cassandra puisse être restaurée, et présente donc les limitations suivantes :
-
Vous ne pouvez pas provisionner, ajouter ou supprimer de nouveaux LSP.
-
Il n’y a aucune garantie qu’un instantané du réseau soit disponible. Si aucun instantané n’est disponible (par exemple en raison du moment de la création de l’instantané horaire et des activités de basculement HA), seules les données actives peuvent être visualisées dans Contrôleur NorthStar. Aucune propriété définie par l’utilisateur ne peut être chargée et prise en compte par NorthStar.
-
Une fois que vous avez restauré le cluster à un fonctionnement normal, vous devez quitter manuellement le mode de sécurité en redémarrant nodejs (infra :web), Toposerver et task_scheduler :
# supervisorctl restart infra:web collector_main:task_scheduler northstar:toposerver