Sprawdzanie stanu SSD w Sophos Firewall za pomocą SMART
Wartość SMART może być przydatna podczas diagnostyki sprzętu. W fizycznych XGS Appliances, w których wewnętrzny dysk SSD jest zamontowany jako /dev/sda, zapytanie smartctl w trybie tylko do odczytu zwraca wpis dotyczący trwałości. W przypadku SFOS 22.0 Sophos nie dokumentuje jednak uniwersalnego polecenia dla administratora, stałej ścieżki dysku ani progu zużycia obowiązującego dla wszystkich modeli. Dlatego najpierw sprawdź urządzenie, węzeł i ścieżkę, a wartość traktuj jako wskazówkę diagnostyczną, nie jako samodzielną podstawę do wymiany.
Bezpieczna diagnostyka zaczyna się w WebAdmin: sprawdź zajętość dysku i działanie systemu, wygeneruj Consolidated troubleshooting report (CTR), a w razie podejrzenia usterki sprzętowej zaangażuj Sophos Support. Opisane niżej polecenie odczytuje istniejące dane SMART i nie uruchamia autotestu. Inne ścieżki urządzeń, testy SMART i polecenia naprawcze wolno stosować wyłącznie w ramach konkretnego zgłoszenia serwisowego.
⚠️ Ważne: Advanced Shell zapewnia bezpośredni dostęp do systemu. Nie próbuj odgadywać ścieżek dysków, nie uruchamiaj autotestów SMART, nie zmieniaj partycji, nie usuwaj ręcznie plików ani nie wymieniaj samodzielnie dysków SSD. Nawet polecenia
system fsck-on-nextbootw Device Console wolno używać tylko na zalecenie Sophos Support: pomaga ono w przypadku błędów montowania/sig,/conflub/var, wymusza sprawdzenie systemu plików na wszystkich partycjach przy następnym restarcie i może uszkodzić system plików, jeśli sprzęt lub SSD nie działa prawidłowo. Opcjeon,offishowodpowiednio włączają, wyłączają lub pokazują stan; ustawieniem domyślnym jestoff. W trybie awaryjnym SFOS może automatycznie włączyć sprawdzanie, na przykład gdy nie można uruchomić bazy konfiguracji, raportów lub sygnatur, zastosować migracji albo brakuje trybu wdrożenia. Bezpieczną procedurę opisuje artykuł Diagnozowanie trybu Failsafe w Sophos Firewall.
Bezpieczna ścieżka diagnostyczna
- W WebAdmin przejdź do Diagnostics > System graphs, jako wykres wybierz Disk usage, a następnie ustaw okres obejmujący początek problemu.
- Sprawdź, czy w tym samym czasie występują nieprawidłowości w raportach, logach, kwarantannie, WebAdmin lub usługach. Wykres Disk usage pokazuje zajęte miejsce, a nie zużycie SSD ani stan SMART.
- Przed aktualizacją firmware sprawdź także komunikaty i powiadomienia firewalla. SFOS 22.0 może dla niektórych modeli XGS Appliance zgłosić wymaganą aktualizację firmware SSD; w konfiguracji HA każdy węzeł jest oddzielnie sprawdzany pod kątem wymagań aktualizacji.
- W sekcji Diagnostics > Tools, przy pozycji Consolidated troubleshooting report, zaznacz System snapshot i All log files, podaj przyczynę diagnostyki, wybierz Generate, a następnie Download. Tryb debugowania nie jest potrzebny do utworzenia System Snapshot.
- W razie błędów I/O, systemu plików, rozruchu lub powtarzających się błędów bazy danych otwórz zgłoszenie w Sophos Support i przekaż CTR, czas wystąpienia, objawy oraz dane urządzenia. Support zdecyduje o dodatkowej diagnostyce w powłoce lub za pomocą SMART oraz o ewentualnym RMA.
Jeśli problem dotyczy wyłącznie braku miejsca, skorzystaj z artykułu Sprawdzanie miejsca na dysku i zarządzanie raportami w Sophos Firewall. Central Firewall Reporting może zmniejszyć zależność od danych raportowych przechowywanych lokalnie. Z kolei Sophos Firewall Health Check ocenia ryzyka związane z konfiguracją i nie zastępuje diagnostyki sprzętu.
Znaczenie widocznych sygnałów
Disk usage pokazuje pojemność, nie zużycie
W sekcji Diagnostics > System graphs > Disk usage oś X przedstawia — zależnie od wybranego okresu — minuty, godziny, dni lub miesiące, a oś Y procent zajętego miejsca. Legenda rozróżnia sygnatury (pomarańczowy), pliki konfiguracyjne (fioletowy), raporty (zielony) i pamięć tymczasową (niebieski). Wysoka wartość może wpływać na raporty i usługi, ale nie dowodzi usterki SSD. Z kolei wolne miejsce nie świadczy o braku usterek sprzętowych ani o pozostałej żywotności zapisu. Wykres nie zawiera atrybutów SMART ani progów zużycia.
Powiadomienie o firmware SSD nie jest wynikiem SMART
W części modeli XGS Appliance przed instalacją SFOS 22.0 lub nowszego może być wymagana aktualizacja firmware SSD poprawiająca niezawodność. Jeśli konieczne jest działanie, pojawi się powiadomienie. Jest to wymaganie aktualizacyjne właściwe dla danego modelu, a nie zmierzona wartość trwałości ani automatyczny dowód usterki.
Dlatego przed aktualizacją sprawdź aktualną kopię zapasową, dostępne miejsce, obsługiwaną ścieżkę aktualizacji, Release Notes i zaplanuj okno serwisowe. W konfiguracji HA oba węzły muszą być dostępne, sprawne i zsynchronizowane oraz każdy z nich musi spełniać wymagania aktualizacji; niespełnienie wymagań przez jeden węzeł może zablokować aktualizację. Aktualizację uruchamiaj wyłącznie z Primary Device.
Dane SMART zależą od modelu
Atrybuty SMART, nazwy urządzeń i ich znaczenie mogą się różnić zależnie od dysku SSD, kontrolera, urządzenia i firmware.
Odczyt trwałości na XGS Appliance z /dev/sda
Zaloguj się do firewalla przez SSH, otwórz Advanced Shell i upewnij się, że pracujesz na właściwym urządzeniu lub właściwym węźle HA. Avanet wykonał to zapytanie na urządzeniu XGS 3100 z systemem SFOS 21.5.1 MR-1 Build 261. Jeśli wewnętrzny SSD jest w nim zamontowany jako /dev/sda, poniższe polecenie odczytuje kompletne dane SMART i wyświetla tylko wiersze zawierające Endurance:
smartctl -x /dev/sda | grep Endurance

W przykładzie Avanet dysk SSD zgłasza surową wartość 1 dla atrybutu Percentage Used Endurance Indicator. Na tym dysku niska wartość oznacza niewielkie zużycie żywotności zapisu. Nie przenoś jednak tej skali bez weryfikacji na inne dyski SSD: nazwa atrybutu, sposób normalizacji i wartość surowa mogą mieć inne znaczenie zależnie od producenta i modelu. Wartość 80 nie jest więc uniwersalnym progiem RMA firmy Sophos. Dokumentuj zmiany wartości w czasie i uwzględniaj objawy, błędy I/O oraz ocenę właściwą dla danego modelu.
Polecenie i zależna od modelu interpretacja były już omawiane publicznie w praktyce, ponieważ nie opisano ich w pomocy Sophos Firewall: Sprawdzanie żywotności SSD w Sophos XGS na Administrator.de. Autor zaleca szybką wymianę po przekroczeniu wartości 80; Avanet świadomie nie uznaje tej wartości podanej przez społeczność za uniwersalny próg RMA firmy Sophos. Powyższy zrzut ekranu pochodzi z urządzenia Avanet, a nie z tego artykułu.
Awaria SSD może nastąpić bez wcześniejszego ostrzeżenia ze strony SFOS. HA chroni ruch sieciowy, ale nie zapewnia automatycznej ochrony wszystkich danych zapisanych lokalnie: awaria węzła może wpłynąć na logi, Mail Queue i kwarantannę; Mail Queue oraz kwarantanna nie są synchronizowane między węzłami HA. Centralne raporty, aktualne kopie zapasowe i udokumentowana procedura ponownego uruchomienia ograniczają ryzyko, lecz nie zastępują monitorowania SSD.
Jeśli polecenie nie zwróci żadnego wiersza, może to oznaczać brak odpowiedniego atrybutu Endurance, niewłaściwą dla tego urządzenia ścieżkę albo brak możliwości odczytania SSD w ten sposób przez smartctl za pośrednictwem zastosowanego kontrolera. Pusty wynik nie świadczy ani o sprawności, ani o usterce. Nie próbuj na tej podstawie innych nazw urządzeń ani nie uruchamiaj autotestu SMART.
Przy dalszej interpretacji przestrzegaj następujących zasad:
- Używaj
/dev/sdatylko wtedy, gdy ta ścieżka została potwierdzona dla konkretnego urządzenia; nie zgaduj ścieżek NVMe ani RAID. - Nie wyprowadzaj ogólnego progu z nazw atrybutów takich jak
Endurance,Percentage UsedczyWear. - Nie podejmuj decyzji o wymianie na podstawie pojedynczej wartości ani różnicy między dwoma węzłami HA.
- Braku wyniku SMART nie interpretuj ani jako sprawności, ani jako usterki.
W konfiguracji HA potwierdzone polecenie wykonuje się oddzielnie na obu węzłach, ponieważ każdy ma własny SSD. Zapisz razem wynik, datę, strefę czasową, wersję SFOS i rolę węzła. Jeśli występują objawy, wartości są wysokie lub szybko rosną albo znaczenie atrybutów jest niejasne, dodaj również numer zgłoszenia i ocenę Sophos Support.
Dokumentowanie i weryfikacja wyniku
Krótka, spójna historia jest bardziej użyteczna niż pojedyncza wartość:
- Data i godzina ze strefą czasową: na przykład
2026-09-05 10:30 CEST - Urządzenie i lokalizacja: na przykład
XGS 2100 – HQ - Numer seryjny i, w przypadku HA, rola:
PrimarylubAuxiliary - Wersja i build SFOS
- Objaw: ostrzeżenie o braku miejsca, błąd I/O, błąd rozruchu, problem z raportami lub bazą danych
- Okres wykresu Disk usage i zauważalna zmiana
- Plik CTR i numer zgłoszenia serwisowego
- Praktyczne zapytanie SMART: potwierdzona ścieżka urządzenia, dokładne polecenie i niezmieniony wynik
Prawidłowy wykres ani pojedyncza wartość SMART nie kończą diagnostyki. W ramach weryfikacji sprawdź, czy po wykonaniu bezpiecznego działania zajętość dysku i dotknięte funkcje pozostają stabilne oraz czy błędy powracają w uzgodnionym okresie obserwacji. W przypadku wirtualnych firewalli stan dysku, datastore, opóźnienia I/O i błędy należy monitorować przede wszystkim w hypervisorze i na platformie storage.
W razie podejrzenia problemów z temperaturą lub wentylatorem skorzystaj z artykułu Sprawdzanie temperatury i wentylatora przez SSH; informacje o stanie i historii obsługiwanych czujników sprzętowych można uzupełnić za pomocą SNMP Hardware Monitoring. Żadna z tych metod nie zastępuje diagnostyki SSD prowadzonej przez Sophos.
Gdy urządzenie działa niestabilnie lub jest niedostępne
Nie wykonuj na próbę poleceń ponownego uruchamiania, sprawdzania systemu plików ani naprawy. Udokumentuj ostatni moment prawidłowego działania, zmiany poprzedzające usterkę, stan diod LED oraz dostępność przez HTTPS, SSH i konsolę szeregową. Przy całkowitym braku zasilania najpierw sprawdź inne gniazdko i inny przewód zasilający; w urządzeniach z dwoma zasilaczami sprawdź drugie wejście, a w modelach, które to obsługują, inny zasilacz hot-swap. Zdjęcie lub film pokazujący diody LED i zachowanie podczas uruchamiania przyspieszy ocenę RMA.
Jeśli urządzenie nie uruchamia się, sprawdź HTTPS i SSH przez LAN oraz WAN, a także konsolę szeregową podłączoną bezpośrednio przez DB-9, konwerter Serial-to-USB lub dostępny w nowszych modelach XGS Appliance port konsoli Micro-USB. W Device Manager na komputerze administratora sprawdź błędy sterownika lub połączenia. Ustaw 38400 bodów, sprawdź stan w kilku odstępach czasu i udokumentuj widoczne błędy zrzutami ekranu. Jeśli konsola nie odpowiada, sprawdź połączenie za pomocą drugiego kabla lub komputera. O tym, czy urządzenie zostanie uznane za DOA, Sophos decyduje dopiero po własnej weryfikacji. Pełną wewnętrzną procedurę zawiera artykuł Usterka sprzętu Sophos: przygotowanie RMA i wymiany.
Jeśli urządzenie jest nadal dostępne, odtwórz błąd bezpośrednio przed zebraniem danych i zanotuj dokładny czas wraz ze strefą czasową. W Diagnostics > Tools > Consolidated troubleshooting report zaznacz System snapshot i All log files, podaj przyczynę, wybierz Generate, a następnie Download. Zaszyfrowany raport prześlij w zgłoszeniu serwisowym. Niektóre logi w CTR zawierają tylko liczbę wierszy skonfigurowaną przez CLI; w przypadku starszego zdarzenia zapisz więc dodatkowo osobno odpowiednie Troubleshooting logs. Tryb debugowania jest domyślnie wyłączony i nie jest potrzebny do utworzenia System Snapshot; logi debugowania zwiększają zajętość dysku i po zakończeniu ukierunkowanego rejestrowania należy je ponownie wyłączyć. W konfiguracji HA logi i raporty nie są synchronizowane, dlatego zbiera się je osobno dla każdego węzła i jednoznacznie do niego przypisuje. Pełną procedurę opisuje artykuł Zabezpieczanie logów Sophos Firewall na potrzeby wsparcia i analizy.
Jeśli Sophos poprosi o dostęp zdalny na potrzeby diagnostyki, w sekcji Diagnostics > Support access można wygenerować ograniczony czasowo Access ID. Firewall nawiązuje w tym celu wychodzące, bezpieczne połączenie sterujące przez TCP 22 z *.apu.sophos.com; znajdujący się przed nim router musi zezwalać na ten ruch. Włącz Support access, potwierdź przyciskiem OK, wybierz czas trwania, kliknij Apply, ponownie OK, a następnie skopiuj unikatowy identyfikator z sekcji Access status. Access ID udostępniaj wyłącznie w zgłoszeniu serwisowym. Umożliwia on Sophos dostęp do WebAdmin i powłoki bez hasła administratora; nieaktywne sesje kończą się po 15 minutach. Dostęp można wyłączyć w dowolnym momencie i zostanie on dezaktywowany po zamknięciu zgłoszenia. Szczegółową wewnętrzną procedurę zawiera artykuł Udostępnianie Sophos Firewall Support Access firmie Avanet.
Przygotowanie zgłoszenia i RMA
Przed eskalacją przygotuj:
- dokładny opis błędu, moment rozpoczęcia, częstotliwość i skutki;
- model, rewizję, numer seryjny, wersję i build SFOS;
- stan HA i dotknięty węzeł;
- historię Disk usage, istotne komunikaty o błędach i CTR;
- aktualną, pobraną kopię zapasową konfiguracji;
- hasło szyfrowania kopii zapasowej i powiązany Secure Storage Master Key — przechowuj je w bezpiecznym miejscu, a udostępniaj wyłącznie bezpieczną metodą wskazaną przez Sophos;
- stan licencji i wsparcia.
Wartość SMART nie uruchamia automatycznie procedury RMA. Zgodnie z procesem Sophos najpierw identyfikuje się błąd i dane urządzenia, a następnie otwiera zgłoszenie i przeprowadza weryfikację; Sophos może zażądać dodatkowej diagnostyki. Formularz RMA wymaga modelu, rewizji, wersji firmware, numeru seryjnego i informacji o przynależności do HA.
W konfiguracji HA trzeba dodatkowo ustalić, który węzeł zostanie wymieniony. Opisana tu procedura odbudowy dotyczy wyłącznie trybu Active-Passive, nie Active-Active, i wiąże się z przestojem. Najpierw zapisz model, rewizję, początkowe urządzenie Primary oraz wersję firmware i build obu urządzeń za pomocą system diagnostics show version-info.
- Przygotowanie urządzenia zastępczego: jeśli identyczny build firmware nie jest dostępny, poproś o niego Sophos Support. Podłącz klienta DHCP do Port 1 i otwórz
https://172.16.16.16:4444. W Setup Assistant skonfiguruj Port 2 wyłącznie jako WAN z dostępem do internetu; na tym etapie nie twórz innych interfejsów. Po wykonaniu reimage lub aktualizacji ponownie sprawdź build za pomocąsystem diagnostics show version-info. - Wymiana Auxiliary: sprawne urządzenie Primary działa tymczasowo samodzielnie. Doprowadź urządzenie zastępcze do tej samej wersji i buildu firmware, przejmij je w Central i przenieś licencję uszkodzonego Auxiliary. Na sprawnym Primary wyłącz HA, poleceniem
service -S | grep msyncpotwierdź stanUNTOUCHEDlubSTOPPED, przepnij okablowanie i ponownie skonfiguruj HA Active-Passive, używając sprawnego urządzenia jako Primary. - Wymiana Primary: wyrejestruj sprawne urządzenie Auxiliary z Central i w sekcji My Products > Firewall Management > Firewalls potwierdź, że nie znajduje się już na liście. Zapisz jego aktualną kopię zapasową. Doprowadź urządzenie zastępcze do tej samej wersji i buildu firmware, przejmij je, przenieś licencję, przywróć kopię zapasową, a po przepięciu okablowania uruchom je samodzielnie do obsługi ruchu. Następnie przywróć ustawienia fabryczne w sprawnym, wcześniejszym Auxiliary, ponownie przejmij je w Central i skonfiguruj HA Active-Passive od nowa z urządzeniem zastępczym jako Primary.
Wymiana zapewnia sprawny sprzęt, ale nie gwarantuje gotowości operacyjnej. Przed oknem serwisowym udokumentuj przeniesienie licencji, zgodność kopii zapasowej, przypisanie w Central, okablowanie i test działania. Podstawowe informacje o rolach zawiera artykuł Klaster HA Sophos Firewall: Active-Passive, Active-Active i Auxiliary Appliance.
Warunki gwarancji i wsparcia podsumowano w artykule Jak długo otrzymuję gwarancję na sprzęt Sophos?. Jeśli Sophos zażąda wykonania reimage, skorzystaj z osobnej procedury Ponowna instalacja Sophos Firewall OS: Reimage za pomocą pamięci USB.
Kontrola końcowa
- Sprawdzono Disk usage i wybrany okres, nie interpretując pojemności jako stanu SSD.
- Udokumentowano objawy, ich przebieg w czasie, model, numer seryjny, wersję SFOS i węzeł HA.
- Aktualną kopię zapasową zapisano poza urządzeniem, a dane niezbędne do odtworzenia są dostępne.
- Wygenerowano CTR z opcjami System snapshot i All log files oraz zapisano go w bezpiecznym miejscu.
- Nie użyto odgadniętych ścieżek urządzeń ani nie uruchomiono autotestów SMART, poleceń
fsck, usuwania czy naprawy bez zgody Supportu. - W razie podejrzenia usterki sprzętowej otwarto zgłoszenie; dodatkową diagnostykę wykonuje się wyłącznie na podstawie konkretnej instrukcji Supportu.
- RMA lub wymianę sprzętu zaplanowano dopiero po weryfikacji przez Sophos.
FAQ
Czy stan SSD można sprawdzić bezpośrednio w WebAdmin?
Jakiego polecenia SMART i jakiej ścieżki urządzenia należy użyć?
/dev/sda, polecenie smartctl -x /dev/sda | grep Endurance odczyta wpis dotyczący trwałości bez uruchamiania autotestu. Dla innych modeli lub ścieżek Sophos nie publikuje uniwersalnego polecenia dla administratora; nie zgaduj ścieżek.Od jakiej wartości SMART należy wymienić SSD?
Czy prawidłowa wartość SMART wystarcza, aby wykluczyć problem?
Jak sprawdzić SSD w klastrze HA?
/dev/sda, wykonaj zapytanie Endurance w trybie tylko do odczytu osobno na obu węzłach i przypisz wynik do roli węzła oraz czasu wykonania. Nie zgaduj innych ścieżek ani testów; różnice interpretuj wyłącznie z uwzględnieniem modelu.