SUR CETTE PAGE
Options de surveillance de haute disponibilité multinodale
Types de surveillance
Une détection de défaillance haute disponibilité surveille les défaillances internes, logicielles et matérielles. Le système peut également surveiller les problèmes de connectivité réseau ou de connectivité des liaisons à l’aide de la surveillance des interfaces, de la surveillance des chemins BFD et de la surveillance IP pour détecter l’accessibilité des cibles plus éloignées.
Le Tableau 1 fournit des détails sur les différents types de surveillance utilisés dans la haute disponibilité multi nodale.
| Type de surveillance | Qu’est-ce que | laportée | dutype de détection |
|---|---|---|---|
| Surveillance BFD | Surveille l’accessibilité jusqu’au saut suivant en examinant la couche de liaison en même temps que la liaison réelle. |
|
|
| Surveillance IP | Surveille la connectivité aux hôtes ou aux services situés au-delà des interfaces directement connectées ou des sauts suivants. |
|
|
| Surveillance des interfaces | Examine si la couche de liaison est opérationnelle ou non. |
Échecs de liaison |
|
En haute disponibilité multi nodale, lorsque la surveillance détecte une défaillance de connectivité à un hôte ou à un service, elle marque le chemin affecté comme indisponible/indisponible et les groupes de routage de services (SRG) correspondants au nœud affecté comme inéligibles. Les SRG concernés passeront à l’autre nœud de manière dynamique sans perturber le trafic.
Pour éviter toute perte de trafic, la haute disponibilité multi nodale prend les précautions suivantes :
- Mode Couche 3 : les itinéraires sont redessinés afin que le trafic soit redirigé correctement
- Passerelle par défaut ou mode hybride : le nouveau nœud actif du SRG envoie un GARP (ARP gratuit) au commutateur connecté pour assurer le réacheminement du trafic
- Scénarios de défaillance de haute disponibilité multi nodale
- Défaillance de nœud
- Défaillance du réseau/de la connectivité
Scénarios de défaillance de haute disponibilité multi nodale
Les sections suivantes décrivent les scénarios de défaillance possibles : comment une défaillance est détectée, quelle action de récupération entreprendre et, le cas échéant, l’impact sur le système causé par la défaillance.Défaillance de nœud
Défaillance matérielle
- Cause : composant matériel défectueux ou problème environnemental tel qu’une panne de courant.
- Détection : en haute disponibilité multi nodale
- L’appareil/nœud affecté n’est pas accessible
- L’état SRG1 passe à
INELIGIBLEsur le nœud en cas de défaillance matérielle.
- Impact —Le trafic bascule vers l’autre nœud (s’il est sain), comme illustré sur la Figure 1. .
Figure 1 : défaillance matérielle dans la haute disponibilité
multi nodale
- Récupération : la récupération d’une défaillance a lieu lorsque vous éliminez la défaillance matérielle du châssis (par exemple, remplacer ou réparer le composant matériel défectueux.
- Résultats : vérifiez l’état à l’aide des commandes suivantes :
Défaillance système/Logiciel
- Cause : défaillance d’un processus ou d’un service logiciel ou d’un problème avec le système d’exploitation.
- Détection : en haute disponibilité multi nodale
- L’appareil/nœud affecté n’est pas accessible
- Modifie l’état du système sur
INELIGIBLEle nœud affecté en cas de défaillance système/logicielle.
- Impact : le trafic bascule vers l’autre nœud s’il est sain, comme illustré sur la Figure 2
Figure 2 : Défaillance Logiciels dans la haute disponibilité
multi nodale
- Récupération : se remet automatiquement et en douceur de la panne une fois le problème résolu. Le nœud de sauvegarde qui a joué le rôle actif continue de le devenir. Le nœud précédemment actif reste le nœud de secours.
- Résultats : vérifiez l’état à l’aide de la commande show chassis high-availability information detail.
Défaillance du réseau/de la connectivité
- Défaillance des interfaces physiques (liaison)
- Défaillance de la liaison interchâssis (ICL)
- Le nœud reste à l’état isolé
Défaillance des interfaces physiques (liaison)
- Cause : une défaillance des interfaces peut être due à une panne d’équipement réseau, à une perturbation des câbles physiques ou à des configurations incohérentes.
- Détection : en haute disponibilité multi nodale
- L’appareil/nœud affecté n’est pas accessible.
- L’état SRG1 passe à
INELIGIBLEsur le nœud affecté en cas d’échec du réseau ou de la connectivité (si l’interface-moniteur est configuré). La connectivité des chemins peut également être détectée avec la surveillance BFD ou IP et déclencher un événement en fonction de l’action configurée.
- Impact : une modification de l’état de la liaison des interfaces déclenche un basculement. Le nœud de sauvegarde assume le rôle actif, et les services qui s’exécutaient sur le nœud défaillant sont migrés vers un autre nœud, comme illustré à la figure 3.
Figure 3 : défaillance d’interface
-
Configuration : pour configurer la surveillance BFD et la surveillance des interfaces, utilisez l’instruction de configuration suivante :
set chassis high-availability services-redundancy-group <1> monitor bfd-liveliness <source-ip-address> <destination-ip-address> routing-instance <routing-instance-name> <single-hop| multihop> <interface-name>
set chassis high-availability services-redundancy-group <1> monitor interface <interface-name>
Toutes les liaisons critiques pour le flux de trafic doivent être surveillées.
Exemple de paiement : Configurer la haute disponibilité multi nodale dans un réseau de couche 3 pour obtenir des détails complets sur la configuration.
- Récupération : récupère lorsque vous réparez/remplacez l’interface défaillante. Une fois l’échec réseau/connectivité récupéré, SRG1 passe de l’état INÉLIGIBLE à l’état BACKUP. Le nouveau nœud actif continue d’annoncer de meilleures mesures à son routeur en amont et traite le trafic.
- Résultats : vérifiez l’état à l’aide des commandes suivantes :
-
Pour plus d’informations sur la configuration des interfaces dans MNHA, consultez Exemple : Configurer la haute disponibilité multinodale dans un réseau de couche 3. Pour dépanner les interfaces, voir Dépannage des interfaces.
Défaillance de la liaison interchâssis (ICL)
- Cause : une défaillance d’ICL peut être due à des pannes réseau ou à des configurations incohérentes.
- Détection : en haute disponibilité multi nodale, les nœuds ne peuvent pas se joindre et lancent une sonde de détermination de l’activité (sonde ICMP).
- Impact : dans un système à haute disponibilité multi nœuds, ICL connecte les nœuds actifs et de secours ; si l’ICL tombe en panne, les deux appareils remarqueront ce changement et démarreront la sonde d’activité (sonde ICMP). Une sonde d’activité est effectuée pour déterminer le nœud qui peut jouer un rôle actif pour chaque SRG1+. En fonction du résultat de la sonde, l’un des nœuds passe à l’état actif.
Comme le montre la figure 4, l’ICL entre SRX-1 et SRX-2 diminue. Les deux appareils ne peuvent pas se joindre et commencent à envoyer des sondes d’activité au routeur en amont. Étant donné que SRX-1 se trouve sur le chemin préféré le plus élevé dans la configuration du routeur, il joue un rôle actif et continue de traiter le trafic et annonce le chemin de préférence plus élevé. L’autre joue le rôle de remplaçant.
Figure 4 : Défaillance ICL dans la haute disponibilité
multi nodale
-
Configuration : pour configurer l’analyse d’activité, utilisez l’instruction de configuration suivante :
set chassis high-availability services-redundancy-group <1> activeness-probe <destination-ip-address> routing-instance <routing-instance-name>
Consultez Configuration de la haute disponibilité multi nodale dans un réseau de couche 3 pour plus de détails sur la configuration.
- Résultats : vérifiez l’état à l’aide des commandes suivantes :
show chassis high-availability information detailshow chassis high-availability services-redundancy-group 1-
Vérifiez la réponse des paquets ICMP à partir du routeur en amont à l’aide de l’option ping. Exemple :
ping <activeness-probe-dest-ip> source <activeness-probe-source-ip> routing-instance <routing-instance-name>.
-
Récupération : une fois que l’un des nœuds assume un rôle actif, la haute disponibilité multinodale redémarre le processus de synchronisation à froid et resynchronise les services du plan de contrôle (VPN IPSec). Les informations sur l’état du SRG sont rééchangées entre les nœuds.
Le nœud reste à l’état isolé
- Cause : dans une configuration haute disponibilité multi nodale, le nœud reste à l’état isolé après un redémarrage et les interfaces associées continuent de rester inactives dans les cas suivants :
-
La liaison interchâssis (ICL) n’a pas de connectivité avec l’autre nœud après le démarrage jusqu’à la fin de la synchronisation à froid
et
-
L’option
shutdown-on-failureest configurée sur SRG0Remarque :La cause ci-dessus peut également se produire si l’autre appareil est hors service.
-
- Détection : l’état SRG0 affiché comme
ISOLATEDdans la sortie de commande. -
Récupération : le nœud se rétablit automatiquement lorsque l’autre nœud est en ligne et que l’ICL peut échanger des informations système ou lorsque vous supprimez l’instruction
shutdown-on-failureet validez la configuration.Utilisez la
delete chassis high-availability services-redundancy-group 0 shutdown-on-failurepour supprimer l’instruction.Si la solution ci-dessus n’est pas adaptée à votre environnement, vous pouvez utiliser l’option
install-on-failure-route. Dans cette option, la configuration haute disponibilité multinodale utilise une route de signal définie pour une gestion plus fluide de la situation ci-dessus à l’aide d’options de politique de routage, ce qui est similaire à l’approche active-signal-route et backup-signal-route disponibles dans SRG1+.
Surveillance flexible des chemins
À partir de la version 23.4R1 de Junos OS, nous avons ajouté de nouvelles améliorations aux fonctionnalités de surveillance de chemin existantes suivantes :
- Surveillance IP
- Surveillance BFD
- Surveillance des interfaces
Les améliorations ajoutent un contrôle plus précis pour la fonctionnalité de surveillance des chemins :
- Extension de la surveillance pour SRG0 en plus de SRG1+
- Regroupement des fonctions de surveillance
- Prise en charge de la surveillance en fonction de la direction associée au chemin d’un groupe de redondance de services (SRG)
- Ajout de poids associés à chaque fonction de surveillance
En regroupant les fonctions associées, le système peut les traiter comme une unité, ce qui peut conduire à un calcul plus efficace et à une utilisation plus efficace des ressources.
- Objets de surveillance SRG
- Configuration de la surveillance des chemins
- Vérifier la configuration des objets de surveillance
Objets de surveillance SRG
Comprenons le concept de surveillance des objets avec l’illustration suivante.
de surveillance SRG
Vous pouvez configurer les options de surveillance par groupe de redondance de service. En d’autres termes, si des éléments spécifiques du SRG venaient à tomber en panne, ce SRG peut basculer vers l’autre nœud. Chaque SSR comprend un ou plusieurs objets de surveillance.
Les fonctions de surveillance disponibles dans la surveillance des objets sont : l’activité BFD, la surveillance des interfaces et la surveillance IP. Chacune de ces entités est associée à une valeur seuil et à des attributs de pondération.
Dans un objet de surveillance, chaque fois que l’objet particulier ne parvient pas à déclencher un basculement à la suite d’une surveillance IP/interface/BFD, le système considère l’événement comme un échec de surveillance. Le logiciel ajoute le nombre en fonction du poids de l’objet défaillant.
Lorsque le nombre dépasse la valeur seuil de IP/interface/BFD, le système ajoute le nombre à la valeur seuil de l'objet de surveillance parent.
Lorsque la somme des seuils de tous les objets de surveillance liés au SRG est égale ou supérieure à la valeur de seuil configurée sur le SRG, le système déclenche une défaillance du moniteur pour ce SRG. SRG bascule vers l’autre nœud.
Configuration de la surveillance des chemins
Considérons l’exemple suivant pour la topologie illustrée à la figure 6. Dans cette configuration, nous configurons les options de surveillance de chemin pour SRG1 sur l’équipement du nœud 2.
chemin
Dans cet exemple, pour configurer les options de surveillance des chemins :
- Utilisez une interface Ethernet agrégée (AE) pour la liaison interchâssis (ICL) et utilisez des interfaces xe-1/0/x pour la connexion aux routeurs voisins.
- Créez deux objets de moniteur « réseau-A » et « réseau-B ». Les objets moniteur réseau-A et réseau-B comprennent toutes les adresses IP et interfaces configurées entre l’appareil SRX Series et les routeurs voisins.
- Configurez BFD pour surveiller les routes voisines.
- Configurez la surveillance IP pour surveiller les routes qui ne sont pas directement connectées à SRG1.
- Configurez la surveillance des interfaces sur les liens directement connectés ou les sauts suivants.
Le tableau suivant présente les pondérations des échantillons et les affectations de seuils.
| Surveiller les objets |
BFD |
IP |
Interface utilisateur |
Seuil moniteur-objet |
Seuil SRG |
|||
|---|---|---|---|---|---|---|---|---|
| Seuil |
Poids |
Seuil |
Poids |
Seuil |
Poids |
|||
| réseau-A | 100 |
50 |
100 |
50 (10.10.10.1, 10.20.20.1, 10.30.30.1) |
100 |
25 (xe-1/0/1 et xe-1/0/2) 50 (AE0 et AE1) |
100 |
100 |
| réseau-B | 100 |
50 |
100 |
50 (10.11.11.1, 10.12.12.1, 10.13.13.1) | 100 |
25 (xe-1/0/3 et xe-1/0/4) 50 (AE2 et AE3) |
200 |
|
- Vous pouvez configurer jusqu’à 10 objets de surveillance par SRG.
- Vous pouvez configurer la surveillance SRG comme dans Junos OS 23.4 (avec le seuil SRG et les objets de surveillance) ou configurer les options de surveillance comme pris en charge avant Junos OS version 23.4R1. La combinaison des deux styles de configuration n’est pas prise en charge.
- La configuration des objets monitor est la même que sur SRG 0 et SRG1+.
Exemples de configuration :
Dans l’extrait de configuration suivant, le groupe de redondance de services (SRGx) inclut deux objets de surveillance : network-A et network-B. Chacun de ces objets de surveillance dispose d’une surveillance IP, d’une surveillance d’interface et d’une détection BFD configurées avec des pondérations et des valeurs de seuil respectives.
- Définissez la valeur seuil de la SSR.
set chassis high-availability services-redundancy-group x monitor srg-threshold 100
- Configurer monitor-object
network-A.- Définissez la valeur seuil de l’objet de surveillance.
set chassis high-availability services-redundancy-group x monitor monitor-object network-A object-threshold 100
-
Configurez les options de surveillance BFD.
set chassis high-availability services-redundancy-group x monitor monitor-object network-A bfd-liveliness threshold 100 set chassis high-availability services-redundancy-group x monitor monitor-object network-A bfd-liveliness dst-ip 10.1.1.1 src-ip 10.1.1.2 session-type multi-hop weight 100
-
Configurez les valeurs de pondération et de seuil pour la surveillance IP.
set chassis high-availability services-redundancy-group x monitor monitor-object network-A ip threshold 100 set chassis high-availability services-redundancy-group x monitor monitor-object network-A ip destination-ip 10.10.10.1 weight 50 set chassis high-availability services-redundancy-group x monitor monitor-object network-A ip destination-ip 20.20.20.1 weight 50 set chassis high-availability services-redundancy-group x monitor monitor-object network-A ip destination-ip 30.30.30.1 weight 50
- Configurez les valeurs de poids et de seuil pour la surveillance des interfaces.
set chassis high-availability services-redundancy-group x monitor monitor-object network-A interface threshold 100 set chassis high-availability services-redundancy-group x monitor monitor-object network-A interface interface-name xe-1/0/1 weight 25 set chassis high-availability services-redundancy-group x monitor monitor-object network-A interface interface-name xe-1/0/2 weight 25 set chassis high-availability services-redundancy-group x monitor monitor-object network-A interface interface-name ae0 weight 50 set chassis high-availability services-redundancy-group x monitor monitor-object network-A interface interface-name ae1 weight 50
- Définissez la valeur seuil de l’objet de surveillance.
-
Configurer monitor-object
network-B.-
Définissez la valeur seuil de l’objet de surveillance.
set chassis high-availability services-redundancy-group x monitor monitor-object network-B object-threshold 200
-
Configurez la surveillance BFD dans l’objet moniteur.
set chassis high-availability services-redundancy-group x monitor monitor-object network-B bfd-liveliness threshold 100 set chassis high-availability services-redundancy-group x monitor monitor-object network-B bfd-liveliness dst-ip 10.2.2.1 src-ip 10.2.2.2 session-type multi-hop weight 100
-
Configurez les valeurs de pondération et de seuil pour la surveillance IP.
set chassis high-availability services-redundancy-group x monitor monitor-object network-B ip threshold 100 set chassis high-availability services-redundancy-group x monitor monitor-object network-B ip destination-ip 10.11.11.1 weight 50 set chassis high-availability services-redundancy-group x monitor monitor-object network-B ip destination-ip 10.21.21.1 weight 50 set chassis high-availability services-redundancy-group x monitor monitor-object network-B ip destination-ip 10.31.31.1 weight 50
-
Configurez les valeurs de poids et de seuil pour la surveillance des interfaces.
set chassis high-availability services-redundancy-group x monitor monitor-object network-B interface threshold 100 set chassis high-availability services-redundancy-group x monitor monitor-object network-B interface interface-name xe-1/0/3 weight 25 set chassis high-availability services-redundancy-group x monitor monitor-object network-B interface interface-name xe-1/0/4 weight 25 set chassis high-availability services-redundancy-group x monitor monitor-object network-B interface interface-name ae2 weight 50 set chassis high-availability services-redundancy-group x monitor monitor-object network-B interface interface-name ae3 weight 50
-
Prenons le cas de network-B , monitor-object dans l’exemple.
Le système a une valeur seuil de 100 pour la surveillance des interfaces et des pondérations attribuées aux interfaces membres (50, 50, 25 et 25). Si une interface de poids 50 diminue, la valeur de poids de l’interface (50) est ajoutée au décompte et comparée à la valeur seuil de la surveillance de l’interface. Autrement dit, le nombre est de 50 et le seuil d’interface est de 100. Le nombre est toujours inférieur à la valeur seuil de l’interface.
Si une autre interface de poids 50 tombe en panne, le nombre est incrémenté de 50 et comparé à la valeur seuil de la surveillance de l’interface. Le nombre est maintenant égal à la valeur seuil de l’interface 100. Lorsque le nombre est égal à la valeur seuil, le système ajoute cette valeur (100) au nombre de l'objet moniteur (réseau-B). La valeur seuil de monitor-object network-B est de 200. Le nombre (100) est toujours inférieur à la valeur seuil de object-monitor.
De même, si le moniteur IP ou le moniteur BFD atteignent également leurs valeurs de seuil respectives et ajoutent au nombre de moniteurs d'objets, le nombre est incrémenté et comparé à la valeur de seuil de moniteurs d'objets. Une fois que le nombre supprime la valeur seuil d'object-monitor, le système ajoute le nombre au nombre du groupe de redondance de service (SRG-1). Si la somme des moniteurs d'objets réseau A et réseau B dépasse la valeur seuil de SRG-1, le système déclenche le basculement vers un autre nœud.
Vérifier la configuration des objets de surveillance
Utilisez les show chassis high-availability services-redundancy-group 1 commandes ou show chassis high-availability services-redundancy-group <id> monitor-object <name> .
L’exemple suivant montre la sortie de show chassis high-availability services-redundancy-group 1 la commande.
user@host> show chassis high-availability services-redundancy-group 1
SRG failure event codes:
BF BFD monitoring
IP IP monitoring
IF Interface monitoring
PM Path monitoring
CP Control Plane monitoring
.............................................
SRG Path Monitor Info:
SRG Monitor Status: UP
SRG Monitor Threshold: 100
SRG Monitor Weight: 0
SRG Monitor Failed Objects: [ NONE ]
Object Name: Network-B
Object Status: UP
Object Monitored Entries: [ IP IF BFD ]
Object Failures: [ IP ]
Object Threshold: 200
Object Current Weight: 0
Object Name: Network-A
Object Status: UP
Object Monitored Entries: [ IP IF BFD]
Object Failures: NONE
Object Threshold: 100
Object Current Weight: 0
Dans la sortie de la commande, vous pouvez voir l’état des objets Network-B de surveillance et Network-A. Vous pouvez également remarquer que les détails de l’objet d’échec dans la sortie ainsi que leurs valeurs de seuil et leur poids.