Operar de forma segura el appliance y el sensor de Sophos NDR
Un appliance Sophos NDR puede alojar dos cargas de trabajo distintas: el sensor NDR, que analiza el tráfico de red replicado, y las integraciones de terceros basadas en el appliance, que en Sophos Fusion también se denominan Log Collector integrations. Por lo tanto, hay dos interfaces relevantes para las operaciones:
- Sophos Fusion es el punto central de acceso e inventario. Muestra los appliances, las integraciones asignadas y métricas generales de recursos, y permite iniciar acciones centrales como Collect logs, Remote Assistance u Open Appliance Manager.
- Sophos Appliance Manager se ejecuta en el appliance y muestra el estado local de la máquina virtual, NDR y los recopiladores de registros. Desde aquí se reinician componentes específicos y se realiza un reinicio o apagado controlado de toda la máquina virtual.
La regla más segura es: reiniciar únicamente el componente más pequeño que se haya demostrado que está afectado. Al reiniciar NDR, los recopiladores de registros siguen funcionando; al reiniciar un recopilador de registros concreto, NDR y las demás integraciones no se ven afectados. En cambio, un Restart o Shutdown de la máquina virtual interrumpe todas las cargas de trabajo del appliance.
Ámbito: Los pasos locales de Restart y Shutdown de este runbook se aplican al appliance virtual administrado en Appliance Manager. No establecen ningún procedimiento de encendido o apagado para hardware NDR certificado.
Selección rápida: ¿qué interfaz y qué acción?
| Tarea | Ubicación | Impacto |
|---|---|---|
| Inventariar el appliance y las integraciones alojadas | Fusion, My Products > NDR > Appliances | solo lectura |
| Comprobar el estado local y la versión | Appliance Manager, Status, NDR, Integrations, Advanced | solo lectura |
| Consultar eventos NDR locales con fines de diagnóstico | Appliance Manager, NDR Query | solo lectura; consulta predefinida en la base de datos local de la VM |
| Reiniciar únicamente el sensor NDR | Appliance Manager, NDR > Restart NDR | NDR se interrumpe; los recopiladores de registros permanecen activos |
| Reiniciar un recopilador de registros | Appliance Manager, Integrations > Restart | solo se reinicia esta integración |
| Reiniciar todos los recopiladores de registros | Appliance Manager, Integrations > Restart All | se reinician todos los recopiladores de registros; NDR permanece activo |
| Solicitar registros del appliance | Fusion, menú del appliance Collect logs | solicitud de diagnóstico, no es un reinicio operativo |
| Reiniciar toda la máquina virtual | Appliance Manager, Actions > Restart | NDR y todos los recopiladores de registros se detienen y se restablecen |
| Apagar toda la máquina virtual | Appliance Manager, Actions > Shutdown | NDR y todos los recopiladores de registros se detienen; es necesario volver a encenderla por separado |
1. Inventariar el appliance y las cargas de trabajo en Sophos Fusion
En My Products > NDR > Appliances se accede a la pestaña Integration Appliances de las integraciones configuradas. Como alternativa, se puede acceder directamente desde Threat Analysis Center > Integrations > Configured > Integration Appliances.
Antes de realizar cualquier cambio, identifique con claridad el appliance correcto y anote los siguientes datos en el registro del cambio o en el caso de soporte:
- nombre del appliance y Type
- Network protocol y Syslog IP
- número mostrado en Integrations
- valores mostrados de CPU, Memory, Storage 1 y Storage 2
- estado de Log requested
- acción prevista, ventana de mantenimiento y persona responsable
Despliegue la flecha situada junto al nombre del appliance. Así se muestran las integraciones que realmente aloja. Para cada entrada, documente en particular Integration name, Vendor, Protocol, Port, Configuration Type y Off/On. Este paso evita reiniciar un supuesto sensor NDR independiente cuando el mismo appliance también procesa datos de syslog de un producto de terceros.
Interpretar correctamente los estados de Fusion
- Waiting for deployment es el estado esperado de un appliance recién creado que todavía no se ha desplegado. Es posible que la imagen aún se esté creando.
- Cuando finaliza la creación de la imagen y aparece Download image, la imagen está lista para descargarla y desplegarla a continuación. Esto todavía no constituye una prueba de funcionamiento ni de conectividad.
- Connected es un estado intermedio tras el despliegue: el appliance ha establecido la conexión con la administración central. Este estado no demuestra que lleguen paquetes a todos los puertos SPAN ni que los datos de NDR se carguen correctamente.
- Off/On corresponde a cada integración mostrada al desplegar la lista e indica si esa integración está activa. No debe confundirse con el estado de conexión del appliance.
- Log requested indica si se ha enviado una solicitud de Collect logs para el appliance. No es un indicador del estado operativo.
Las métricas de recursos de Fusion ofrecen una visión general del conjunto de appliances, no un diagnóstico local completo. Para evaluar un appliance concreto, abra a continuación Appliance Manager.
2. Abrir Appliance Manager y registrar una línea base
En el menú de tres puntos del appliance, seleccione Open Appliance Manager y confirme el cuadro de diálogo con Open. Appliance Manager se abre en una ventana nueva.
La cuenta local se llama zadmin. En un appliance recién creado, la contraseña se muestra una sola vez al guardarla y debe almacenarse de forma segura. En un appliance existente, o si se ha olvidado la contraseña, se puede establecer una nueva mediante reset it en el cuadro de diálogo de apertura. Si la cuenta se ha bloqueado por demasiados intentos incorrectos, puede utilizarse como alternativa la consola web del hipervisor: en Weblink interface, seleccione Unlock Account. Esto presupone que ya se dispone de acceso autorizado al hipervisor; no se deben deducir de esta opción pasos mediante shell, SSH o consola. Nunca incluya una contraseña en un ticket ni en un registro de operaciones.
Antes de intervenir, registre los siguientes datos de referencia del encabezado de Appliance Manager:
- Version
- K3S Helm Chart version
- Uptime
- System ID
A continuación, compruebe las cuatro pestañas operativas:
- Status muestra el uso local de la CPU y la memoria, así como el uso de los discos raíz y de datos.
- NDR muestra el porcentaje de carga de datos, la captura de cada puerto SPAN configurado y el gráfico de flujo de red en intervalos de 30 segundos. SPAN port 2 solo aparece si hay un segundo puerto configurado.
- Integrations muestra el estado, el último reinicio y los contadores Received, Filtered, Accepted y Uploaded de cada recopilador de registros.
- Advanced muestra el estado y las horas de reinicio de los contenedores en los que se ejecutan las integraciones.
Registre los valores con marcas de tiempo, en lugar de anotar simplemente «verde» o «funciona». Para compararlos después de la intervención, normalmente basta con una captura de pantalla o con los valores relevantes; no se requieren exportaciones completas.
Comprobar eventos locales con NDR Query
NDR Query de Appliance Manager es una herramienta de diagnóstico local: consulta la base de datos de eventos NDR de esa máquina virtual concreta. Esta base de datos no es Sophos Data Lake. NDR Query tampoco es Investigation Console: Investigation Console es una consola de búsqueda de amenazas que se despliega por separado, funciona en la red local y tiene asignado un NDR Appliance.
Para realizar un diagnóstico compatible en Appliance Manager:
- Anote la franja horaria del error, el nombre del appliance y la cuestión que se desea investigar.
- Abra NDR Query y seleccione Example queries en la página Query.
- En Example queries, busque la consulta predefinida adecuada para la cuestión y seleccione el icono Copy situado junto a ella.
- Pegue la consulta copiada en el cuadro de texto y seleccione el icono Go.
- Guarde la salida de Query Results junto con la franja horaria. Las columnas se pueden reordenar mediante arrastrar y soltar para facilitar el análisis.
Actualmente, Appliance Manager solo ofrece estas consultas predefinidas. No cree una consulta SQL propia ni utilice aquí una consulta de Investigation Console. Documente también los resultados vacíos; por sí solos no demuestran ni que falte tráfico SPAN ni que haya fallado la carga en Data Lake. Compruebe estas fases por separado en NDR.
3. Cambiar la configuración de forma controlada
Las opciones de Management Interface, Proxy, SYSLOG y SPAN se encuentran en Actions > Settings. Un cambio no comienza al guardarlo, sino al comprobar su ámbito:
- ¿Se puede confirmar la discrepancia localmente en Appliance Manager y en Fusion?
- ¿Afecta a la conexión de administración, a la recepción de syslog o a la captura de paquetes de NDR?
- ¿Qué cargas de trabajo de NDR y de recopilación de registros comparten el appliance?
- ¿Se ha documentado el valor inicial y existe una vía para revertir el cambio?
- ¿Requiere esta configuración concreta reiniciar la máquina virtual?
No cambie la configuración de administración, proxy o red para probar posibles soluciones sin un diagnóstico previo. Una configuración de administración incorrecta puede hacer que Appliance Manager y la conexión con Sophos Fusion queden inaccesibles. Los cambios en SYSLOG pueden afectar a las integraciones de terceros; la configuración de SPAN solo corresponde a NDR. Por tanto, antes de guardar, cambie únicamente el área afectada y no pruebe varias hipótesis de error al mismo tiempo.
Si la interfaz exige un reinicio para aplicar un cambio, no lo inicie de inmediato. Realice primero las comprobaciones previas descritas en la sección siguiente y utilice una ventana de mantenimiento adecuada.
Global NDR Settings: habilitar OS Detection de forma deliberada
Si existe una integración NDR en el appliance, Global NDR Settings contiene las opciones VLAN Strip y OS Detection. Ambas están desactivadas de forma predeterminada. OS Detection no es un valor pasivo del sensor: cuando se activa, el appliance utiliza Nmap cada dos horas para analizar todas las direcciones IP internas que NDR haya visto en la red e identificar así el sistema operativo. Estos análisis pueden generar detecciones en otros productos de seguridad.
Por ello, antes de activarla, documente la finalidad, las redes internas afectadas, la aprobación de los responsables de red y seguridad y las detecciones que se esperan. Si no se permiten análisis de los sistemas internos o no se pueden supervisar sus efectos en otras herramientas, mantenga OS Detection desactivada.
Para una activación autorizada:
- Documente el estado inicial de OS Detection, el appliance, la hora y los sistemas de prueba internos previstos.
- Active OS Detection y modifique únicamente esta opción.
- Durante al menos un intervalo completo de dos horas, compruebe que la opción permanece activa y si las herramientas de seguridad responsables notifican las detecciones de análisis esperadas o inesperadas. Compruebe en paralelo el estado de NDR, la carga y los Log Collectors.
- Evalúe el resultado con los responsables. Las alertas inesperadas, los sistemas de destino no autorizados o los efectos operativos constituyen criterios para interrumpir la prueba.
Reversión: vuelva a desactivar OS Detection y documente la hora. Después, compruebe que no se añadan nuevos eventos de análisis provocados por esta función; las alertas ya generadas en otras herramientas deben tratarse conforme a sus respectivos procesos. No reproduzca manualmente comandos de Nmap ni cree excepciones en los sistemas de destino sin un diagnóstico confirmado.
Corregir Management localmente solo si la VM está sin conexión
La página local Actions > Settings > Management es una vía de recuperación únicamente cuando la VM no tiene conectividad de red. Mientras haya conectividad, los cambios de administración se realizan en Sophos Fusion. Este runbook no presupone un acceso a una VM sin conexión que no exista ya: los pasos siguientes solo son aplicables si se puede acceder al panel mediante una vía de recuperación existente y autorizada. Si no se dispone de ella, escale el caso al responsable de la plataforma o a Sophos Support.
Antes del cambio, registre los valores actuales y previstos de IP Assignment, IPv4/Netmask, Gateway IP, DNS, DNS 2 y, si se utiliza, Enable Web Proxy, Web Proxy Type, Proxy URL y Port Number. Gestione el Username y el Password del proxy exclusivamente en el sistema de contraseñas. Además, inventaríe todas las cargas de trabajo alojadas de NDR y de los Log Collectors, porque un cambio confirmado que requiera reinicio interrumpe todo el appliance, no solo la interfaz de administración.
Modifique únicamente el valor imprescindible: para establecer una dirección fija, seleccione Edit en IPv4 configuration, defina IP Assignment como Static, introduzca la dirección con el prefijo CIDR, el gateway y DNS, y seleccione Save. Configure un proxy web mediante Enable Web Proxy y el Web Proxy Type apropiado solo si realmente es necesario. Antes de confirmar, vuelva a comprobar la dirección de destino, el gateway, DNS, la accesibilidad del proxy, la ventana de mantenimiento y la vía para restaurar los valores iniciales documentados.
Si la interfaz muestra una confirmación de reinicio, se trata de un reinicio de la VM: se interrumpen NDR y todos los Log Collectors del appliance. Una vez aplicado el cambio, compruebe Appliance Manager mediante la nueva dirección IP y, a continuación, valide la conexión con Sophos Fusion, la carga de NDR, la actividad SPAN y cada Log Collector conforme a la sección 7. Si la validación falla y aún se dispone del acceso de recuperación, restaure exclusivamente los últimos valores de administración modificados a la línea base documentada. De lo contrario, no pruebe más valores de red; escale el caso con la línea base y el mensaje visible.
4. Limitar la interrupción al componente más pequeño
Solo NDR presenta problemas
Si se puede acceder al appliance y a los recopiladores de registros, pero el sensor NDR no funciona correctamente, compruebe primero en NDR la carga de datos, la captura SPAN y el flujo de red. Si el problema persiste, utilice Restart NDR.
Este reinicio afecta al analizador de tráfico de red NDR, no a las integraciones de terceros del mismo appliance. Aun así, durante el reinicio se produce una interrupción de la visibilidad de NDR. Por lo tanto, documente la hora y la duración y, a continuación, vuelva a comprobar los indicadores de NDR.
Solo un recopilador de registros presenta problemas
En Integrations, seleccione la tarjeta de la integración afectada y, antes de intervenir, registre el estado, el último reinicio y los contadores de syslog. Restart reinicia únicamente esta integración. NDR y las demás integraciones del appliance permanecen activas.
Restart All solo es adecuado si hay varios recopiladores de registros afectados o si Sophos Support especifica este ámbito. La acción reinicia todas las integraciones de terceros del appliance, pero no NDR. No se debe utilizar por comodidad en lugar de aislar el problema en una sola integración.
Todo el appliance presenta problemas
Actions > Restart es el siguiente nivel de intervención si el problema no se puede limitar a NDR o a un recopilador de registros, o si está pendiente un reinicio necesario del appliance. La acción detiene y restablece todas las integraciones de la máquina virtual. Por lo tanto, un reinicio siempre provoca una interrupción simultánea de NDR y de todos los recopiladores de registros de este appliance.
Actions > Shutdown detiene el appliance y todas sus integraciones. Utilice esta acción únicamente si se garantiza, tanto a nivel organizativo como técnico, que después se podrá volver a encender mediante el hipervisor, la plataforma en la nube o el acceso al hardware.
5. Comprobaciones previas a un reinicio o apagado
Antes de intervenir en todo el appliance, se deben abordar todos los puntos siguientes:
- Ámbito: se ha verificado el appliance por su nombre y System ID, y se han inventariado en Fusion todas las integraciones de NDR y de recopilación de registros alojadas.
- Impacto: los equipos responsables saben que la telemetría de NDR y el procesamiento de syslog se interrumpirán al mismo tiempo.
- Línea base: se han registrado con marcas de tiempo el inventario de Fusion, la versión y el tiempo de actividad locales, los estados de las pestañas y los contadores relevantes.
- Acceso: se puede acceder a Appliance Manager; en caso de apagado, se ha comprobado la vía para volver a encender el appliance.
- Motivo del cambio: se han documentado los síntomas, el efecto esperado y los criterios de éxito.
- Ventana de mantenimiento: se han reservado una ventana de mantenimiento y un periodo de observación posterior a la intervención.
- Soporte: se han tenido en cuenta las recopilaciones de registros o sesiones de soporte en curso, y se han guardado las pruebas de diagnóstico existentes antes del reinicio.
Si no se dispone de acceso para volver a encender el appliance, Shutdown no debe utilizarse como intento de diagnóstico. Si solo está afectado un componente, reiniciar toda la máquina virtual tiene un alcance excesivo.
6. Ejecutar un reinicio o apagado
Para reiniciar la máquina virtual en Appliance Manager, seleccione Actions > Restart. Para realizar un apagado planificado, seleccione Actions > Shutdown. Mientras la acción está en curso, no inicie otro reinicio ni otra acción de encendido o apagado en el hipervisor. De este modo quedará claro qué acción ha causado el estado observado.
Después de Shutdown, el estado operativo esperado es que Appliance Manager, NDR y todos los recopiladores de registros alojados dejen de estar disponibles. Documente este estado y la hora como resultado del apagado planificado. Una máquina virtual detenida no se puede encender desde su propio Appliance Manager: la persona responsable debe encenderla mediante el acceso al hipervisor o a la nube comprobado previamente.
Un apagado no es un procedimiento de retirada, eliminación ni borrado. Este runbook no abarca la eliminación de un appliance en Fusion, la retirada de la máquina virtual, el borrado de datos ni la retirada completa del servicio. No deduzca dichos pasos a partir del menú visible Delete.
7. Validar el funcionamiento después de la intervención
Después de reiniciar NDR, una integración o la máquina virtual, compruebe siempre el mismo ámbito que se documentó previamente. Si el appliance permanece apagado después de un apagado planificado, la validación termina con el estado detenido documentado en la sección 6. Si se vuelve a encender de forma externa, espere hasta que Appliance Manager vuelva a estar accesible y, a continuación, realice la comprobación completa en los niveles del appliance, NDR y los recopiladores de registros. Connected por sí solo no sustituye esta validación.
Nivel del appliance
- Vuelva a abrir Appliance Manager.
- Compare System ID y Version con la línea base.
- Compruebe si Uptime concuerda con el reinicio realizado.
- En Status, confirme que vuelven a mostrarse la CPU, la memoria y los discos raíz y de datos.
- En Fusion, compruebe que se pueda acceder al appliance en Integration Appliances y que las integraciones esperadas sigan asignadas.
Sensor NDR
- En NDR, compruebe si el gráfico de flujo de red vuelve a mostrar intervalos nuevos.
- Para cada puerto SPAN configurado, compruebe si aparecen métricas de captura.
- Compruebe si los datos vuelven a cargarse en Sophos Fusion.
El mero hecho de que el estado del appliance sea visible no demuestra que el tráfico replicado llegue al sensor. Del mismo modo, un único valor porcentual sin nuevos flujos de red no demuestra un funcionamiento estable. Utilice varios indicadores locales que sean coherentes entre sí.
Recopiladores de registros
Para cada integración inventariada previamente, compruebe lo siguiente en Integrations:
- estado
- hora del último reinicio
- actividad nueva en Received
- procesamiento trazable mediante Filtered y Accepted
- Uploaded
En un appliance de uso mixto, la validación solo finaliza cuando se han comprobado tanto NDR como todos los recopiladores de registros. «El appliance está en línea» no es un criterio de éxito suficiente.
8. Registros y Sophos Support
Solicitar registros en Fusion
En Fusion, vaya a Threat Analysis Center > Integrations > Configured > Integration Appliances y seleccione Collect logs en el menú de tres puntos del appliance. Log requested indica que se ha enviado la solicitud. Coordine con Sophos Support la posterior obtención y transferencia de los archivos de registro concretos; este runbook operativo no incluye deliberadamente un procedimiento independiente de descarga o carga.
Limitar temporalmente Remote Assistance
El appliance debe estar en línea. En Fusion, vaya a Threat Analysis Center > Integrations > Configured > Integration Appliances y abra Remote Assistance en el menú del appliance. En el cuadro de diálogo:
- Active Enable.
- Marque la casilla de confirmación de Sophos Group Privacy Notice.
- Seleccione Save.
- Espere hasta que Fusion muestre un Access ID.
- Envíe únicamente el Access ID a Sophos Support por el canal acordado.
Remote Assistance se desactiva automáticamente en un plazo máximo de siete días. Si el análisis finaliza antes, desactive Enable en el mismo cuadro de diálogo. El Access ID no es información de acceso de uso general y no debe compartirse con terceros ni incluirse en tickets públicos.
Para una escalación, normalmente basta con proporcionar el nombre del appliance, System ID, la versión, la hora con zona horaria, la carga de trabajo afectada, el estado observado y el esperado, la acción realizada, el resultado de la comprobación posterior y el estado de Log requested. No envíe contraseñas ni exportaciones completas innecesarias.
Límites para una operación segura
- Sin instrucciones de eliminación: Delete, la retirada de la máquina virtual, su reconstrucción y el borrado de datos no forman parte de este runbook.
- Sin reinicios generales como primer paso: empiece por comprobaciones de solo lectura y, después, reinicie de forma aislada NDR o exactamente un recopilador de registros.
- Sin apagado sin una vía de encendido: asegúrese primero de que se dispone de acceso al hipervisor, a la plataforma en la nube o al personal responsable del hardware.
- Sin cambios simultáneos: no cambie los valores de red, proxy, SYSLOG y SPAN en un único cambio conjunto que no se pueda desglosar.
- Sin credenciales en los paquetes de pruebas: la contraseña de
zadmin, los tokens y otros secretos deben permanecer en el sistema de gestión de contraseñas. - Sin dar por resuelto el problema solo porque aparezca «en línea»: el appliance, NDR y cada recopilador de registros requieren sus propios criterios de éxito.