Vai al contenuto
Avanet

Pianificare Sophos Switch come livello di accesso per XGS HA

Gli switch Sophos possono costituire il livello di accesso davanti a una coppia HA di Sophos Firewall. Il principio di sicurezza è semplice: il Dedicated HA Link collega direttamente i due firewall XGS e rimane separato da tutti i percorsi di switching di produzione. LAN, DMZ ed eventualmente WAN vengono distribuite su due switch, in modo che il guasto di uno switch non disconnetta contemporaneamente entrambi i nodi firewall dalla stessa rete.

Questo runbook copre il lato switch e cablaggio. La scelta effettiva tra Active-Passive e Active-Active nonché la configurazione completa del firewall spiegano Configurazione dell’alta disponibilità di Sophos Firewall.

Importante: Due firewall da soli non eliminano uno switch comune, un alimentatore comune o un percorso comune del provider come causa di guasto. Uno stato HA Active-Passive o Active-Active conferma solo il cluster firewall, non la ridondanza dell’intero livello di accesso.

Architettura target e limiti di sicurezza

Un design robusto separa tre tipi di traffico:

  1. Dedicated HA Link: connessione fisica diretta tra Primary e Auxiliary. Su di esso vengono eseguiti l’heartbeat e la sincronizzazione della configurazione, dello stato e delle sessioni. In Active-Active, il collegamento viene utilizzato anche per la distribuzione del traffico interno HA tra Primary e Auxiliary. Tuttavia non si tratta di una normale interfaccia LAN, DMZ o WAN e non è integrata in nessuna di queste reti di produzione.
  2. Percorsi di produzione: Connessioni da ciascun nodo firewall a LAN, DMZ e WAN. Entrambi i nodi devono essere in grado di raggiungere le stesse reti di produzione dopo un cambio di ruolo.
  3. Percorsi di gestione: Accesso a firewall e switch per l’accettazione, la risoluzione dei problemi e lo rollback. Almeno un accesso indipendente non deve dipendere dall’esatto collegamento attualmente in fase di modifica o test.

Il riferimento documentato da Sophos utilizza due CS210-48FP per LAN e DMZ. Ogni nodo del firewall è connesso ad uno dei due switch; Una porta diretta trasporta LAN e DMZ-VLAN Tagged tra gli switch. Uno CS110-24FP separato esegue il lato WAN di entrambi i firewall e la connessione Internet in uno Untagged VLAN. Anche in questo esempio è collegato direttamente lo Dedicated HA Link dei firewall.

Questo esempio non è un piano generale delle porte generale. I numeri di porta e gli ID VLAN servono solo per comprendere i ruoli:

ScopoValore di riferimentoSignificato
LANVLAN 100Firewall, LAN e porte di interconnessione switch
DMZVLAN 200Firewall, DMZ e porte di interconnessione switch
WANVLAN 300Entrambe le porte firewall WAN e handover Internet
Cambia collegamentoPorta 52VLAN 100 e 200 Tagged
Dedicated HA LinkPorta firewall 7Collegamento diretto, non tramite gli switch

Gli ID VLAN, le porte e i nomi delle interfacce vengono presi dal piano di rete esistente. Non si copiano i valori di riferimento in una rete produttiva in cui hanno già un significato diverso.

Il che non rende automaticamente ridondante il progetto di riferimento

Il singolo interruttore di riferimento WAN rimane una zona di guasto comune. Se fallisce, entrambi i nodi firewall perdono questo percorso WAN. Se si vuole che il livello di commutazione WAN sopravviva anche al guasto di un singolo dispositivo, è necessario un design a doppio switch e provider testato separatamente; XGS HA non crea da solo questa ridondanza.

Anche due switch montati uno accanto all’altro non costituiscono zone di guasto separate. Per garantire una separazione affidabile, controllare almeno:

  • alimentazione separata o percorsi di corrente separati con fusibili;
  • hardware dello switch separato e, ove possibile, percorsi rack o patch separati;
  • un nodo firewall per switch anziché entrambi i nodi sullo stesso switch di accesso;
  • Percorsi cavi separati senza patch condivise o rischi legati al ricetrasmettitore;
  • Accessibilità delle reti di produzione tramite ogni switch singolarmente;
  • Monitoraggio per entrambi gli switch ed entrambi i percorsi firewall;
  • responsabilità documentata per errori di switch, firewall e provider.

Questa assegnazione non viene solo registrata nel piano di rete, ma viene anche portata avanti come parte della matrice degli obiettivi fino al collaudo e allo rollback. Ciò significa che rimane visibile quali dipendenze di alimentazione, rack, patch, switch e provider ha effettivamente un percorso specifico.

VLAN, LAG e STP progettano insieme

La topologia di livello 2 è completamente definita prima del cablaggio. Per ogni rete, il piano include l’ID VLAN, il ruolo Tagged/Untagged, PVID, le porte firewall coinvolte, le porte dello switch e il percorso previsto dopo un errore. L’implementazione di Tagged, Untagged e PVID è in Configurare in modo sicuro i Sophos Switch VLAN.

Mantieni gli VLAN coerenti su entrambi gli switch

Nella configurazione di riferimento di Sophos, il firewall e le porte di rete per LAN e DMZ sono membri dei rispettivi VLAN. L’interconnessione tra i due switch CS210 trasporta VLAN 100 e 200 Tagged. Lo PVID delle porte Untagged corrisponde al rispettivo VLAN; Sophos imposta Ingress filtering: On e Accept type: All nell’esempio.

Le seguenti regole di test si applicano al tuo progetto:

  • Uno VLAN deve avere lo stesso ID VLAN su ogni estremità del collegamento coinvolta.
  • Sono ammessi sull’interlink solo gli VLAN Tagged che devono effettivamente raggiungere entrambi gli switch.
  • Untagged VLAN e PVID di una porta di accesso devono corrispondere.
  • Lo Dedicated HA Link non è incluso in nessuno di questi VLAN di produzione.
  • La gestione VLAN e il percorso di ritorno rimangono accessibili durante il cambio.
  • Il filtraggio dell’ingresso verrà rafforzato solo dopo aver dimostrato l’appartenenza a VLAN e PVID.

Il riferimento è basato sulla porta e Untagged sulle interfacce firewall. Se il vostro firewall utilizza invece sottointerfacce o trunk VLAN, non dovete adottare i valori Untagged/PVID dell’esempio. Quindi il percorso Tagged sul firewall, sullo switch e sull’interconnessione deve corrispondere in modo coerente al design della tua interfaccia.

Non confondere LAG con la ridondanza dello chassis

Uno LAG raggruppa diversi collegamenti a una stazione remota logica. A seconda della distribuzione del traffico, aumenta la capacità e può assorbire il guasto di un membro. Ma ciò non prova che un cambiamento completo possa fallire.

Le due origini condivise Sophos non documentano uno LAG multi-chassis su due switch Sophos indipendenti per questo esempio XGS-HA. Pertanto, un firewall LAG non è semplicemente distribuito sullo Switch A e sullo Switch B con un membro ciascuno. Una tale struttura è consentita solo se l’intera soluzione switch funziona esplicitamente come controparte logica LAG supportata del firewall e la progettazione specifica è documentata e testata separatamente.

Senza questa prova, interfacce firewall separate per switch separati rappresentano il limite di pianificazione sicura. LACP, LAG statici, attivazione dei membri e disattivazione coperti Configurare in modo sicuro le porte degli switch Sophos, LAG e Spanning Tree.

Pianifica STP davanti a un percorso Layer 2 ridondante

Non appena è possibile creare più di un percorso Layer 2 tra due switch o tramite l’infrastruttura downstream LAN/DMZ, è necessario stabilire la topologia senza loop prima di collegare il cavo aggiuntivo. RSTP è adatto per una topologia condivisa semplice; MSTP solo per progettazione di regioni e istanze deliberatamente coerenti.

Prima della modifica nella matrice di destinazione vengono incluse le priorità Root Bridge e bridge desiderate, le porte di inoltro o di blocco previste e il comportamento in caso di guasto e ripristino dell’interlink. Con MSTP è inclusa anche l’assegnazione VLAN alla rispettiva istanza. Le porte Edge sono riservate ai dispositivi finali reali, non a firewall, switch o connessioni bridge sconosciute. In caso di mancata convergenza viene stabilito un approccio gestionale indipendente.

Loopback Detection può essere utile in aggiunta, ma non sostituisce STP. Una porta STP bloccante non rappresenta automaticamente un errore in un percorso ridondante pianificato.

Preparati al cambiamento

Prima della prima modifica viene creata una matrice di destinazione per entrambi i nodi firewall ed entrambi gli switch. È il documento di lavoro vincolante per la costruzione, il collaudo, l’accettazione e lo rollback. Il seguente esempio compatto mostra la struttura. XGS-A, SW-A, numeri di porta e VLAN sono valori di esempio realistici, non specifiche del prodotto; I valori divergenti vengono presi dalla propria rete e dal piano patch. Le informazioni tra parentesi quadre devono ancora essere compilate e devono essere sostituite con valori ambientali specifici prima del approvazione.

Matrice target CHG-[numero]: stato di esempio prima della modifica
HA: Active-Passive | XGS-A = Primary/Active | XGS-B = Auxiliary/Passive | in modo sincrono
HA dedicato: XGS-A Porta7 <-> XGS-B Porta7 | direttamente | non fa parte del test di fallimento
Percorso di gestione/ritorno: [percorso amministrativo separato] | Responsabile: [Nome]
STP: RSTP | Radice: SW-A [Priorità] | Secondario: SW-B [Priorità]
Backup/stato precedente: [Archiviazione Switch/Firewall] | Programma delle patch: [versione] | Rilascio di rollback: [Nome]

P1 LAN: XGS-A Porta1 <-> SW-A 1/0/47 | VLAN 100 Untagged/PVID 100
no LAG | RSTP Forwarding, non Edge | Monitored Port: sì | Percorso attuale A
P2 LAN: XGS-B Porta1 <-> SW-B 1/0/47 | VLAN 100 Untagged/PVID 100
no LAG | RSTP Forwarding, non Edge | Monitored Port: sì | Percorso attuale B
Collegamento P3: SW-A 1/0/52 <-> SW-B 1/0/52 | VLAN 100,200 Tagged
PVID [secondo il concetto VLAN nativo locale] | no LAG | RSTP Forwarding
[Completa i percorsi DMZ, WAN e LAG nello stesso schema; per stazione remota logica LAG
e nominare tutti i membri. Contrassegnare esplicitamente le zone di guasto WAN/provider condivise.]

Failover della porta monitorata T1: prerequisito XGS-A Primary/Active, XGS-B Auxiliary/Passive,
entrambi sincroni; separare esattamente XGS-A Port1/P1.
Aspettativa/Percorso: XGS-A non elabora più il traffico; XGS-B diventa Active;
Il traffico LAN passa attraverso P2 e SW-B.
Convalida: stato di entrambi i nodi, sincronizzazione dopo la restituzione, switch porte/percorso VLAN,
Gateway + [destinazione interna] + [percorso esterno] + [applicazione critica], timestamp.
Interruzione: entrambi i nodi Active, perdita di gestione o guasto del traffico > [durata del approvazione].
Ritorno: ricollegare P1, attendere la sincronizzazione, verificare nuovamente il percorso dati;
Solo allora è possibile ripristinare i ruoli preferiti in modo controllato, senza failback incontrollato.
Guasto interruttore T2: [Isola SW-A] | Aspettativa/Percorso: Servizio tramite XGS-B/SW-B e P2
Validazione: [stessi test tecnici] | Risoluzione: [criterio]
Ritorno: crea SW-A/link individualmente, attendi che STP sia stabile e HA sia sincrono.

Le righe P vengono copiate per altre reti e viene copiata una riga T separata per ogni caso di errore approvato. Ciò significa che la stazione remota fisica, la zona, il ruolo VLAN/PVID, Tagged/Untagged, lo stato LAG e STP, il ruolo Monitored Port, HA e lo stato attuale non sono presenti in liste di controllo separate. Il percorso di fallimento previsto, la convalida tecnica, l’interruzione e il percorso di ritorno rimangono direttamente collegati all’interfaccia testata.

Prima della finestra di manutenzione, le configurazioni dello switch e del firewall a cui si fa riferimento nell’intestazione, la porta effettiva, il pre-stato VLAN, LAG e STP, nonché il piano dei cavi e delle patch devono essere effettivamente protetti e accessibili tramite il percorso di amministrazione indipendente specificato. La semplice immissione di una posizione di archiviazione non è sufficiente.

Un backup dello switch non sostituisce la documentazione dello stato effettivo del Livello 2. La differenza tra Fusion e il backup locale è spiegata in Backup e ripristino di Sophos Switch.

Crea il livello di accesso in modo controllato

1. Preparare gli switch senza loop parallelo

  1. Elaborare una dopo l’altra le righe P della matrice di destinazione: configurare prima gli VLAN, gli PVID e l’interconnessione di commutazione pianificata e confermare lo stato effettivo direttamente nella stessa riga.
  2. Prima di abilitare un percorso Layer 2 ridondante, accendere STP e controllare Root Bridge e i ruoli delle porte.
  3. Lasciare i cavi aggiuntivi scollegati o mantenere le relative porte disabilitate.
  4. Chiarire l’origine della configurazione e i conflitti tra Sophos Fusion e la configurazione dello switch locale.
  5. Testare nuovamente l’accesso alla gestione dopo ogni modifica.

Nell’interfaccia web locale dello Switch, il riferimento Sophos per VLAN utilizza:

Configure > VLAN settings > 802.1Q

PVID, Ingress filtering e Accept type vengono modificati lì sotto PVID and ingress filter. Ulteriori passaggi dell’interfaccia utente e i relativi limiti di sicurezza rimangono nel runbook VLAN collegato in modo che non vengano mantenute due istruzioni diverse.

2. Attivare esattamente un percorso di produzione per rete

Innanzitutto per LAN, DMZ e WAN viene attivato solo il percorso individuale chiaramente pianificato. Quindi controlli:

  • Condizioni del collegamento e velocità concordata;
  • adesione effettiva VLAN e PVID;
  • Gestione accessi a switch e firewall;
  • Accessibilità del gateway previsto;
  • Traffico di prova consentito attraverso il firewall attualmente attivo.

Solo quando questo stato è stabile verrà attivato individualmente un ulteriore collegamento di commutazione, un membro LAG o un secondo percorso di rete. Dopo ciascun cavo, vengono nuovamente controllati il ruolo di STP, l’appartenenza a LAG e l’accesso alla gestione.

Lo Dedicated HA Link è collegato direttamente tra le stesse porte designate su entrambi i firewall. Non viene instradato tramite l’interconnessione dello switch produttivo, uno LAN-/DMZ-/WAN-VLAN o uno switch di accesso condiviso. Ciò mantiene un errore nella topologia di livello 2 di produzione separata dall’heartbeat, dalla sincronizzazione e dal percorso di distribuzione interna HA. In Active-Active, questo collegamento diretto può anche distribuire il traffico tra i nodi per l’elaborazione; Ciò significa che non diventa una normale connessione di rete produttiva.

Il riferimento Sophos configura il firewall nel Interactive mode: prima lo Auxiliary, poi lo Primary. Entrambi utilizzano la stessa porta di collegamento e passphrase HA dedicati. Su Primary vengono impostati l’ID cluster, l’indirizzo del collegamento peer, i valori Monitored Ports, Peer Administration e Keepalive. Questi campi del firewall non sono adottati ciecamente dall’esempio di riferimento; Il processo completo e i requisiti sono disponibili nell’articolo collegato sul Firewall HA.

4. Selezionare Monitored Ports in base al dominio di errore

Uno Monitored Port ha lo scopo di rilevare un errore di percorso rilevante. Il cambiamento di ruolo o di stato che ne risulta dipende dalla modalità HA e dal nodo o percorso interessato. Nell’esempio Sophos, Primary monitora le sue porte LAN e DMZ. Per il tuo ambiente vengono selezionate solo le interfacce critiche e connesse in modo permanente.

Le porte non utilizzate, attive solo temporaneamente o disconnesse intenzionalmente non sono utili. Si attiverebbe un failover non necessario. Lo Dedicated HA Link e lo Monitored Port rimangono interfacce diverse con compiti diversi.

Test di accettazione e di fallimento

I test si svolgono in una finestra di manutenzione. Prima di ogni test di fallimento, i modifiche in produzione in corso vengono interrotti, vengono annotati i ruoli attuali e viene nominata una persona responsabile del percorso di ritorno immediato. Viene modificato solo un dominio di errore alla volta.

Ogni test della porta monitorata segue una linea T approvata come T1: la modalità HA, il nodo interessato, il ruolo configurato, lo stato attuale di Active/Passive, l’interfaccia esatta, le aspettative e le condizioni di terminazione vengono riconfermati immediatamente prima della disconnessione. Il normale test di failover Active-Passive disconnette specificamente un’interfaccia monitorata del nodo di elaborazione del traffico attualmente attivo; il peer deve assumere il controllo del traffico. Per Active-Active o un percorso del nodo Auxiliary, viene approvata una riga T separata con il comportamento effettivamente previsto invece di richiedere il cambio di ruolo da T1.

Verificare lo stato di base

Prima di un failover, lo stato normale deve essere chiaro:

  • Entrambi gli switch sono raggiungibili e le relative porte previste sono stabili.
  • Le appartenenze VLAN, i collegamenti PVID e Tagged corrispondono alla matrice di destinazione.
  • Gli LAG contengono solo i membri pianificati.
  • I ruoli e gli stati delle porte Root Bridge, STP sono coerenti con il design.
  • Entrambi i firewall mostrano la modalità pianificata HA e uno stato sincrono.
  • Dedicated HA Link e tutti gli Monitored Ports selezionati sono attivi.
  • Testare i client che raggiungono il gateway, le destinazioni interne esplicitamente consentite e il percorso esterno previsto.
  • Lavori di amministrazione tra pari o di gestione indipendente.

Manutenzione e test degli errori in un ordine sicuro

  1. Disconnettere un membro LAG in modo controllato, se presente. Il percorso logico deve funzionare sul restante membro; quindi aggiungi nuovamente il membro e controlla la sua appartenenza.
  2. Scollegare Interlink dello switch in modo controllato. Fallo solo se il percorso dei dati previsto è chiaramente descritto nel piano senza di esso. Controlla i ruoli, la raggiungibilità di VLAN e l’integrità di STP, quindi ripristina il collegamento e osserva la riconvergenza.
  3. Disconnettere il percorso del firewall monitorato specificato nella matrice di destinazione. In Active-Passive viene utilizzata l’esatta interfaccia monitorata del nodo di elaborazione del traffico attualmente attivo e viene verificato se il peer prende il sopravvento come documentato. I test del percorso Active-Active e Auxiliary seguono solo lo stato previsto documentato separatamente. Se c’è una discrepanza, interrompere il test e ripristinare il percorso. Quindi controlla la sincronizzazione, lo stato di entrambi i nodi e lo stesso traffico di test; non consentire che un failback automatico proceda in modo incontrollabile.
  4. Disconnettere o isolare completamente un interruttore di accesso in modo controllato. L’altro switch, il nodo firewall associato e le reti previste devono fornire il servizio previsto nella progettazione.
  5. Ripristina lo stato normale preferito in modo controllato. I ruoli di switch, collegamenti e firewall possono essere restituiti solo dopo una sincronizzazione stabile e un percorso dati verificato.

Lo Dedicated HA Link non viene disconnesso come normale test di disponibilità nella rete produttiva in esecuzione. Il suo fallimento può far sì che entrambi i firewall non vedano più il peer. Un simile test split-brain richiede una procedura separata, esplicitamente approvata con interfacce produttive isolate. Per la normale accettazione è sufficiente verificare lo stato del collegamento, la sincronizzazione dello HA e la procedura documentata per il suo fallimento.

Un test non si considera superato semplicemente perché il ping continua. Dopo ogni passaggio vengono controllati anche i ruoli, la sincronizzazione, gli stati delle porte dello switch, il percorso VLAN e le applicazioni critiche per il sito. Le osservazioni e le marche temporali vengono inserite nel registro operativo; I tempi di commutazione garantiti non possono essere richiesti senza misurazione.

Isola gli errori per sintomo

HA è verde, ma non è possibile raggiungere una rete dopo il cambio di ruolo

  • Confronta l’ID VLAN e l’appartenenza a Tagged/Untagged su entrambi gli switch.
  • Controllare PVID della porta Untagged interessata.
  • Verificare se lo VLAN è effettivamente approvato tramite l’interconnessione Tagged.
  • Controllare la porta del firewall e il cablaggio fisico rispetto alla matrice di destinazione.
  • Per un LAG, determinare se tutti i membri portano alla controparte logica corretta.
  • STP controllo ruolo della porta; un percorso inaspettatamente bloccato o disabilitato può impedire l’accessibilità.

Il failover si verifica in modo imprevisto

  • Controllare sul firewall quale Monitored Port ha attivato la condizione.
  • Esaminare i flap del collegamento, i ricetrasmettitori, i cavi e la regolazione della velocità/duplex sulla porta dello switch associata.
  • Assicurarsi che nessuna porta opzionale o intenzionalmente non connessa venga monitorata.
  • Controllare lo stato LBD e STP prima di riattivare una porta.

Entrambi i firewall non vedono più il peer

Dedicated HA Link è il primo limite di prova. Non ricollegare in modo casuale i cavi produttivi e non riavviare entrambi i nodi contemporaneamente. Determinare quale nodo deve continuare il traffico, disconnettere o arrestare l’altro dalla rete di produzione in modo controllato, quindi controllare i cavi, le porte e lo stato del collegamento diretto HA. Solo dopo un contatto stabile tra pari e ruoli chiari il secondo nodo sarà nuovamente completamente integrato.

Dopo aver attivato il secondo percorso, si verifica una perdita di pacchetti o un loop

  1. Scollegare in modo controllato l’ultimo collegamento aggiuntivo attivato.
  2. Creare nuovamente un percorso individuale univoco.
  3. STP Root Bridge, controllare i ruoli e gli stati delle porte di entrambi gli switch.
  4. Per un tipo LAG e porte membro, confrontare su entrambe le estremità.
  5. Controllare l’elenco dei collegamenti VLAN e la possibile connessione Untagged involontaria.
  6. Dopo la correzione riattivare esattamente un collegamento aggiuntivo.

Lo switch non è più gestibile

Utilizzare l’accesso di gestione indipendente predisposto. Annulla l’ultima modifica a Management-VLAN, PVID, Uplink, LAG o STP in base allo stato precedente. Per precauzione non riavviare entrambi gli switch: ciò potrebbe comportare la perdita del percorso dati ancora funzionante.

Rollback

Uno rollback ripristina lo stato precedente documentato e inizia dall’ultima ridondanza aggiunta:

  1. Interrompere il traffico di prova e salvare lo stato corrente di HA, switch e STP.
  2. Scollegare in modo controllato l’ultimo collegamento aggiuntivo attivato, membro LAG o interconnessione finché non esiste nuovamente un percorso di produzione chiaro.
  3. Restituisci i ruoli firewall solo se il percorso normale previsto è stabile.
  4. Annulla le modifiche LAG, STP e VLAN su entrambe le estremità del collegamento in ordine inverso.
  5. Ripristinare le precedenti appartenenze Tagged/Untagged e PVID dalla matrice di destinazione.
  6. Ripetere l’accesso alla gestione, la sincronizzazione HA e lo stesso test funzionale di prima della modifica.
  7. Lasciare lo Dedicated HA Link collegato direttamente così com’è, a meno che questo collegamento esatto non venga riparato utilizzando la procedura approvata.

Se lo stato precedente aveva solo uno switch comune o un unico uplink, lo rollback ne ripristina deliberatamente la minore disponibilità. Ciò è documentato nella conclusione della modifica come un rischio residuo e non è descritto come un successo completamente ridondante.

Lista di controllo operativa

  • Ciascuna riga P della matrice target contiene lo stato attuale confermato; Le deviazioni sono state risolte o rilasciate come rischio residuo.
  • Ogni riga T contiene risultato, timestamp e verificatore. I test sono stati eseguiti individualmente, non come un fallimento combinato.
  • I ruoli Dedicated HA Link, HA, la sincronizzazione, lo stato STP e l’accesso alla gestione sono tornati allo stato normale approvato.
  • La configurazione di switch e firewall, il piano patch aggiornato e il registro dei test tecnici vengono salvati nella posizione di archiviazione specificata.
  • Il percorso di rollback, le parti responsabili e le restanti zone di guasto comuni di alimentazione, patch, rack, WAN o fornitore vengono registrati nel completamento della modifica.