Help us improve your experience.

Let us know what you think.

Do you have time for a two-minute survey?

 
 

Options de surveillance de haute disponibilité multinodale

Types de surveillance

Une détection de défaillance haute disponibilité surveille les défaillances internes, logicielles et matérielles. Le système peut également surveiller les problèmes de connectivité réseau ou de connectivité des liaisons à l’aide de la surveillance des interfaces, de la surveillance des chemins BFD et de la surveillance IP pour détecter l’accessibilité des cibles plus éloignées.

Le Tableau 1 fournit des détails sur les différents types de surveillance utilisés dans la haute disponibilité multi nodale.

la du
Tableau 1 : Types de surveillance haute disponibilité multinodale
Type de surveillance Qu’est-ce queportéetype de détection
Surveillance BFD Surveille l’accessibilité jusqu’au saut suivant en examinant la couche de liaison en même temps que la liaison réelle.
  • Défaillances de chemin
  • Échecs de liaison
  • Détecte les défaillances dans sa connectivité de routage
  • Non destiné à détecter les défaillances au-delà des connexions directes/sauts suivants.
Surveillance IP

Surveille la connectivité aux hôtes ou aux services situés au-delà des interfaces directement connectées ou des sauts suivants.

  • Défaillances de chemin
  • Échecs de liaison
  • Détecte les défaillances se produisant sur des hôtes ou des services plus éloignés.
  • Non destiné à détecter les défaillances survenant dans les liaisons directement connectées ou les défaillances de saut suivant.
Surveillance des interfaces

Examine si la couche de liaison est opérationnelle ou non.

Échecs de liaison
  • Détecte les défaillances dans les liens ou les sauts suivants, directement connectés et la connectivité aux hôtes ou services situés plus loin.
  • Non destiné à surveiller le chemin

En haute disponibilité multi nodale, lorsque la surveillance détecte une défaillance de connectivité à un hôte ou à un service, elle marque le chemin affecté comme indisponible/indisponible et les groupes de routage de services (SRG) correspondants au nœud affecté comme inéligibles. Les SRG concernés passeront à l’autre nœud de manière dynamique sans perturber le trafic.

Pour éviter toute perte de trafic, la haute disponibilité multi nodale prend les précautions suivantes :

  • Mode Couche 3 : les itinéraires sont redessinés afin que le trafic soit redirigé correctement
  • Passerelle par défaut ou mode hybride : le nouveau nœud actif du SRG envoie un GARP (ARP gratuit) au commutateur connecté pour assurer le réacheminement du trafic

Scénarios de défaillance de haute disponibilité multi nodale

Les sections suivantes décrivent les scénarios de défaillance possibles : comment une défaillance est détectée, quelle action de récupération entreprendre et, le cas échéant, l’impact sur le système causé par la défaillance.

Défaillance de nœud

Défaillance matérielle

  • Cause : composant matériel défectueux ou problème environnemental tel qu’une panne de courant.
  • Détection : en haute disponibilité multi nodale
    • L’appareil/nœud affecté n’est pas accessible
    • L’état SRG1 passe à INELIGIBLE sur le nœud en cas de défaillance matérielle.
  • Impact —Le trafic bascule vers l’autre nœud (s’il est sain), comme illustré sur la Figure 1. .
    Figure 1 : défaillance matérielle dans la haute disponibilité Network diagram showing failover from SRX-1 to SRX-2 via Interchassis Link. Orange cross on SRX-1 indicates failure. Traffic rerouted to SRX-2. Paths highlighted in orange and blue dashed lines. multi nodale
  • Récupération : la récupération d’une défaillance a lieu lorsque vous éliminez la défaillance matérielle du châssis (par exemple, remplacer ou réparer le composant matériel défectueux.
  • Résultats : vérifiez l’état à l’aide des commandes suivantes :

Défaillance système/Logiciel

  • Cause : défaillance d’un processus ou d’un service logiciel ou d’un problème avec le système d’exploitation.
  • Détection : en haute disponibilité multi nodale
    • L’appareil/nœud affecté n’est pas accessible
    • Modifie l’état du système sur INELIGIBLE le nœud affecté en cas de défaillance système/logicielle.
  • Impact : le trafic bascule vers l’autre nœud s’il est sain, comme illustré sur la Figure 2
    Figure 2 : Défaillance Logiciels dans la haute disponibilité Network topology with Juniper SRX devices in high availability setup. SRX-1 fails, traffic reroutes to SRX-2. Resilient HA ensures uninterrupted traffic. multi nodale
  • Récupération : se remet automatiquement et en douceur de la panne une fois le problème résolu. Le nœud de sauvegarde qui a joué le rôle actif continue de le devenir. Le nœud précédemment actif reste le nœud de secours.
  • Résultats : vérifiez l’état à l’aide de la commande show chassis high-availability information detail.

Défaillance du réseau/de la connectivité

Défaillance des interfaces physiques (liaison)

  • Cause : une défaillance des interfaces peut être due à une panne d’équipement réseau, à une perturbation des câbles physiques ou à des configurations incohérentes.
  • Détection : en haute disponibilité multi nodale
    • L’appareil/nœud affecté n’est pas accessible.
    • L’état SRG1 passe à INELIGIBLE sur le nœud affecté en cas d’échec du réseau ou de la connectivité (si l’interface-moniteur est configuré). La connectivité des chemins peut également être détectée avec la surveillance BFD ou IP et déclencher un événement en fonction de l’action configurée.
  • Impact : une modification de l’état de la liaison des interfaces déclenche un basculement. Le nœud de sauvegarde assume le rôle actif, et les services qui s’exécutaient sur le nœud défaillant sont migrés vers un autre nœud, comme illustré à la figure 3.
    Figure 3 : défaillance d’interface Network topology with Juniper SRX devices in high availability setup, showing failover paths and connections to routers and network cloud.
  • Configuration : pour configurer la surveillance BFD et la surveillance des interfaces, utilisez l’instruction de configuration suivante :

    Toutes les liaisons critiques pour le flux de trafic doivent être surveillées.

    Exemple de paiement : Configurer la haute disponibilité multi nodale dans un réseau de couche 3 pour obtenir des détails complets sur la configuration.

  • Récupération : récupère lorsque vous réparez/remplacez l’interface défaillante. Une fois l’échec réseau/connectivité récupéré, SRG1 passe de l’état INÉLIGIBLE à l’état BACKUP. Le nouveau nœud actif continue d’annoncer de meilleures mesures à son routeur en amont et traite le trafic.
  • Résultats : vérifiez l’état à l’aide des commandes suivantes :
  • Pour plus d’informations sur la configuration des interfaces dans MNHA, consultez Exemple : Configurer la haute disponibilité multinodale dans un réseau de couche 3. Pour dépanner les interfaces, voir Dépannage des interfaces.

Défaillance de la liaison interchâssis (ICL)

  • Cause : une défaillance d’ICL peut être due à des pannes réseau ou à des configurations incohérentes.
  • Détection : en haute disponibilité multi nodale, les nœuds ne peuvent pas se joindre et lancent une sonde de détermination de l’activité (sonde ICMP).
  • Impact : dans un système à haute disponibilité multi nœuds, ICL connecte les nœuds actifs et de secours ; si l’ICL tombe en panne, les deux appareils remarqueront ce changement et démarreront la sonde d’activité (sonde ICMP). Une sonde d’activité est effectuée pour déterminer le nœud qui peut jouer un rôle actif pour chaque SRG1+. En fonction du résultat de la sonde, l’un des nœuds passe à l’état actif.

    Comme le montre la figure 4, l’ICL entre SRX-1 et SRX-2 diminue. Les deux appareils ne peuvent pas se joindre et commencent à envoyer des sondes d’activité au routeur en amont. Étant donné que SRX-1 se trouve sur le chemin préféré le plus élevé dans la configuration du routeur, il joue un rôle actif et continue de traiter le trafic et annonce le chemin de préférence plus élevé. L’autre joue le rôle de remplaçant.

    Figure 4 : Défaillance ICL dans la haute disponibilité Network topology featuring Juniper SRX devices in chassis cluster for high availability with active SRX-1 and backup SRX-2. multi nodale
  • Configuration : pour configurer l’analyse d’activité, utilisez l’instruction de configuration suivante :

    Consultez Configuration de la haute disponibilité multi nodale dans un réseau de couche 3 pour plus de détails sur la configuration.

  • Résultats : vérifiez l’état à l’aide des commandes suivantes :
  • Récupération : une fois que l’un des nœuds assume un rôle actif, la haute disponibilité multinodale redémarre le processus de synchronisation à froid et resynchronise les services du plan de contrôle (VPN IPSec). Les informations sur l’état du SRG sont rééchangées entre les nœuds.

Le nœud reste à l’état isolé

  • Cause : dans une configuration haute disponibilité multi nodale, le nœud reste à l’état isolé après un redémarrage et les interfaces associées continuent de rester inactives dans les cas suivants :
    • La liaison interchâssis (ICL) n’a pas de connectivité avec l’autre nœud après le démarrage jusqu’à la fin de la synchronisation à froid

      et

    • L’option shutdown-on-failure est configurée sur SRG0

      Remarque :

      La cause ci-dessus peut également se produire si l’autre appareil est hors service.

  • Détection : l’état SRG0 affiché comme ISOLATED dans la sortie de commande.
  • Récupération : le nœud se rétablit automatiquement lorsque l’autre nœud est en ligne et que l’ICL peut échanger des informations système ou lorsque vous supprimez l’instruction shutdown-on-failure et validez la configuration.

    Utilisez la delete chassis high-availability services-redundancy-group 0 shutdown-on-failure pour supprimer l’instruction.

    Si la solution ci-dessus n’est pas adaptée à votre environnement, vous pouvez utiliser l’option install-on-failure-route . Dans cette option, la configuration haute disponibilité multinodale utilise une route de signal définie pour une gestion plus fluide de la situation ci-dessus à l’aide d’options de politique de routage, ce qui est similaire à l’approche active-signal-route et backup-signal-route disponibles dans SRG1+.

Surveillance flexible des chemins

À partir de la version 23.4R1 de Junos OS, nous avons ajouté de nouvelles améliorations aux fonctionnalités de surveillance de chemin existantes suivantes :

  • Surveillance IP
  • Surveillance BFD
  • Surveillance des interfaces

Les améliorations ajoutent un contrôle plus précis pour la fonctionnalité de surveillance des chemins :

  • Extension de la surveillance pour SRG0 en plus de SRG1+
  • Regroupement des fonctions de surveillance
  • Prise en charge de la surveillance en fonction de la direction associée au chemin d’un groupe de redondance de services (SRG)
  • Ajout de poids associés à chaque fonction de surveillance

En regroupant les fonctions associées, le système peut les traiter comme une unité, ce qui peut conduire à un calcul plus efficace et à une utilisation plus efficace des ressources.

Objets de surveillance SRG

Comprenons le concept de surveillance des objets avec l’illustration suivante.

Figure 5 : Objets Conceptual diagram of SRGx Threshold system with two Monitor Objects, each containing BFD Liveness, IP Monitoring, and Interface Monitoring Thresholds. de surveillance SRG

Vous pouvez configurer les options de surveillance par groupe de redondance de service. En d’autres termes, si des éléments spécifiques du SRG venaient à tomber en panne, ce SRG peut basculer vers l’autre nœud. Chaque SSR comprend un ou plusieurs objets de surveillance.

Les fonctions de surveillance disponibles dans la surveillance des objets sont : l’activité BFD, la surveillance des interfaces et la surveillance IP. Chacune de ces entités est associée à une valeur seuil et à des attributs de pondération.

Dans un objet de surveillance, chaque fois que l’objet particulier ne parvient pas à déclencher un basculement à la suite d’une surveillance IP/interface/BFD, le système considère l’événement comme un échec de surveillance. Le logiciel ajoute le nombre en fonction du poids de l’objet défaillant.

Lorsque le nombre dépasse la valeur seuil de IP/interface/BFD, le système ajoute le nombre à la valeur seuil de l'objet de surveillance parent.

Lorsque la somme des seuils de tous les objets de surveillance liés au SRG est égale ou supérieure à la valeur de seuil configurée sur le SRG, le système déclenche une défaillance du moniteur pour ce SRG. SRG bascule vers l’autre nœud.

Configuration de la surveillance des chemins

Considérons l’exemple suivant pour la topologie illustrée à la figure 6. Dans cette configuration, nous configurons les options de surveillance de chemin pour SRG1 sur l’équipement du nœud 2.

Figure 6 : exemple de configuration de surveillance de Network topology diagram showing SRX-1 and SRX-2 connected via ICL with physical and logical links. Highlights monitoring for Network-A and Network-B with BFD Liveness, IP Monitoring, and Interface Monitoring thresholds and weights. chemin

Dans cet exemple, pour configurer les options de surveillance des chemins :

  • Utilisez une interface Ethernet agrégée (AE) pour la liaison interchâssis (ICL) et utilisez des interfaces xe-1/0/x pour la connexion aux routeurs voisins.
  • Créez deux objets de moniteur « réseau-A » et « réseau-B ». Les objets moniteur réseau-A et réseau-B comprennent toutes les adresses IP et interfaces configurées entre l’appareil SRX Series et les routeurs voisins.
  • Configurez BFD pour surveiller les routes voisines.
  • Configurez la surveillance IP pour surveiller les routes qui ne sont pas directement connectées à SRG1.
  • Configurez la surveillance des interfaces sur les liens directement connectés ou les sauts suivants.

Le tableau suivant présente les pondérations des échantillons et les affectations de seuils.

Tableau 2 : Pondérations et seuil pour les objets de moniteur (exemple)

Surveiller les objets

BFD

IP

Interface utilisateur

Seuil moniteur-objet

Seuil SRG

 

Seuil

Poids

Seuil

Poids

Seuil

Poids

réseau-A

100

50

100

50 (10.10.10.1, 10.20.20.1, 10.30.30.1)

100

25 (xe-1/0/1 et xe-1/0/2)

50 (AE0 et AE1)

100

100

réseau-B

100

50

100

50 (10.11.11.1, 10.12.12.1, 10.13.13.1)

100

25 (xe-1/0/3 et xe-1/0/4)

50 (AE2 et AE3)

200

Remarque :
  • Vous pouvez configurer jusqu’à 10 objets de surveillance par SRG.
  • Vous pouvez configurer la surveillance SRG comme dans Junos OS 23.4 (avec le seuil SRG et les objets de surveillance) ou configurer les options de surveillance comme pris en charge avant Junos OS version 23.4R1. La combinaison des deux styles de configuration n’est pas prise en charge.
  • La configuration des objets monitor est la même que sur SRG 0 et SRG1+.

Exemples de configuration :

Dans l’extrait de configuration suivant, le groupe de redondance de services (SRGx) inclut deux objets de surveillance : network-A et network-B. Chacun de ces objets de surveillance dispose d’une surveillance IP, d’une surveillance d’interface et d’une détection BFD configurées avec des pondérations et des valeurs de seuil respectives.

  • Définissez la valeur seuil de la SSR.
  • Configurer monitor-object network-A.
    • Définissez la valeur seuil de l’objet de surveillance.
    • Configurez les options de surveillance BFD.

    • Configurez les valeurs de pondération et de seuil pour la surveillance IP.

    • Configurez les valeurs de poids et de seuil pour la surveillance des interfaces.
  • Configurer monitor-object network-B.

    • Définissez la valeur seuil de l’objet de surveillance.

    • Configurez la surveillance BFD dans l’objet moniteur.

    • Configurez les valeurs de pondération et de seuil pour la surveillance IP.

    • Configurez les valeurs de poids et de seuil pour la surveillance des interfaces.

Prenons le cas de network-B , monitor-object dans l’exemple.

Le système a une valeur seuil de 100 pour la surveillance des interfaces et des pondérations attribuées aux interfaces membres (50, 50, 25 et 25). Si une interface de poids 50 diminue, la valeur de poids de l’interface (50) est ajoutée au décompte et comparée à la valeur seuil de la surveillance de l’interface. Autrement dit, le nombre est de 50 et le seuil d’interface est de 100. Le nombre est toujours inférieur à la valeur seuil de l’interface.

Si une autre interface de poids 50 tombe en panne, le nombre est incrémenté de 50 et comparé à la valeur seuil de la surveillance de l’interface. Le nombre est maintenant égal à la valeur seuil de l’interface 100. Lorsque le nombre est égal à la valeur seuil, le système ajoute cette valeur (100) au nombre de l'objet moniteur (réseau-B). La valeur seuil de monitor-object network-B est de 200. Le nombre (100) est toujours inférieur à la valeur seuil de object-monitor.

De même, si le moniteur IP ou le moniteur BFD atteignent également leurs valeurs de seuil respectives et ajoutent au nombre de moniteurs d'objets, le nombre est incrémenté et comparé à la valeur de seuil de moniteurs d'objets. Une fois que le nombre supprime la valeur seuil d'object-monitor, le système ajoute le nombre au nombre du groupe de redondance de service (SRG-1). Si la somme des moniteurs d'objets réseau A et réseau B dépasse la valeur seuil de SRG-1, le système déclenche le basculement vers un autre nœud.

Vérifier la configuration des objets de surveillance

Utilisez les show chassis high-availability services-redundancy-group 1 commandes ou show chassis high-availability services-redundancy-group <id> monitor-object <name> .

L’exemple suivant montre la sortie de show chassis high-availability services-redundancy-group 1 la commande.

Dans la sortie de la commande, vous pouvez voir l’état des objets Network-B de surveillance et Network-A. Vous pouvez également remarquer que les détails de l’objet d’échec dans la sortie ainsi que leurs valeurs de seuil et leur poids.