Saltar para o conteudo
Avanet

Monitorizar o estado e a capacidade do Sophos NDR

Um estado verde do Sophos NDR é uma verificação intermédia importante, mas não comprova uma cobertura de espelhamento completa nem uma cadeia de deteção funcional. Para uma avaliação fiável, é necessário considerar separadamente seis grupos de sinais: Sophos Fusion, Appliance Manager, entrada SPAN, carregamento, processamento e armazenamento e, se existir, a Investigation Console autónoma.

Verificação rápida: comece por consultar o estado do NDR no Sophos Fusion. Em seguida, no Appliance Manager, em NDR, verifique os valores de cada porta SPAN esperada, Uploaded e o histórico dos fluxos. Em Status, verifique a CPU, a Memory, o Root Disk e o Data Disk. Um aviso amarelo spanX: packets being dropped significa que estão a ser descartados mais de 10 % dos pacotes de rede processados pelo NDR. Uma porta SPAN verde cumpre atualmente o classificador do produto de pelo menos 2 % de pacotes unicast. Nenhuma destas afirmações comprova, por si só, que todas as redes previstas estão a ser espelhadas ou que uma deteção chega ao fim da cadeia.

Associar corretamente os indicadores

SinalLocalizaçãoO que comprova
Vermelho, amarelo ou verdeSophos Fusion, integração NDREstado agregado da integração e mensagem de estado específica
NDRAppliance ManagerPercentagem de carregamento, percentagem capturada por cada porta SPAN configurada e Network Flows em intervalos de 30 segundos
StatusAppliance ManagerUtilização de CPU, Memory, Root Disk e Data Disk da appliance
IntegrationsAppliance ManagerEstado e contadores syslog das integrações de terceiros executadas na mesma appliance, não o tráfego SPAN do NDR
Investigation ConsoleComponente separadoO respetivo estado não comprova o estado da integração NDR nem a cobertura SPAN

Abra o Appliance Manager no Sophos Fusion através de Threat Analysis Center > Integrations > Configured > Integration Appliances. Na linha da appliance, selecione os três pontos e depois Open Appliance Manager. A área do cabeçalho apresenta, entre outras informações, Version, K3S Helm Chart version, Uptime e System ID. Inclua estas informações em todos os registos de incidentes, pois duas appliances com sintomas aparentemente semelhantes podem ter versões de software ou tempos de atividade diferentes.

Utilizar o estado do Fusion como ponto de partida

O Sophos Fusion distingue três estados:

  • Vermelho: a integração NDR não está a funcionar. NDR containers not ready, <specific container names> indica aplicações que não estão prontas. Upload to s3 failed ... diz respeito ao carregamento para a cloud. spanX: unhealthy span diz respeito à entrada de tráfego proveniente do dispositivo de rede que efetua o espelhamento.
  • Amarelo: a integração funciona, mas com erros. spanX: packets being dropped é apresentado quando são descartados mais de 10 % dos pacotes de rede.
  • Verde: a integração está a receber tráfego SPAN e a processar dados de pacotes sem erros comunicados. Atualmente, uma porta SPAN é classificada como saudável se pelo menos 2 % dos pacotes observados forem pacotes unicast.

Os dois valores percentuais têm denominadores diferentes e não podem ser compensados entre si. O limiar de 2 % classifica a composição do tráfego que chega ao sensor. Não significa que 2 % de todo o tráfego da empresa seja suficiente, nem que o NDR possa perder 98 %. «Pelo menos 2 %» inclui exatamente 2 %. Em contrapartida, a mensagem relativa aos descartes descreve a proporção dos pacotes que já chegam ao NDR que o processamento não consegue tratar devido à falta de recursos. A Sophos documenta o aviso para mais de 10 %, não para «10 % ou mais».

Importante: o limiar de mais de 10 % é um estado do produto, não um valor-alvo nem um orçamento de perdas aceitável. Mesmo um valor inferior ao limiar de notificação pode representar uma degradação face à respetiva linha de base. Do mesmo modo, uma porta verde pode fornecer tráfego espelhado de forma incorreta ou incompleta, desde que a mistura observada cumpra o classificador de unicast.

Verificar separadamente a entrada SPAN e o carregamento

No Appliance Manager, o separador NDR apresenta um valor de captura para cada porta SPAN configurada. SPAN Port 2 só aparece se tiver sido configurada uma segunda porta. O gráfico global de Network Flows é apresentado em intervalos de 30 segundos.

Estes indicadores respondem a três perguntas distintas:

  1. Está a chegar tráfego a cada porta SPAN esperada? Um valor em falta ou subitamente muito diferente direciona primeiro a investigação para o switch de origem, a sessão de espelhamento ou SPAN, a atribuição da interface de rede virtual e as VLANs ou os grupos de portas alterados recentemente.
  2. A composição do tráfego é plausível? O verde confirma apenas o classificador de unicast atual. O histórico dos fluxos também tem de corresponder aos horários e locais habituais e aos picos de tráfego esperados.
  3. O NDR consegue processar os pacotes? A mensagem amarela relativa aos descartes indica um estrangulamento de processamento. Não é o mesmo que uma porta de espelhamento com excesso de subscrições ou perda de pacotes no percurso de produção.

A percentagem de carregamento, também visível no separador NDR, corresponde a uma etapa posterior. Uma entrada SPAN saudável com um carregamento em queda não indica a mesma categoria de falha que uma porta SPAN vazia. Perante Upload to s3 failed. Request was received but an error code was returned, verifique o acesso de saída à Internet da appliance, bem como as regras da firewall e do proxy Web. O NDR carrega os dados para um bucket S3 através de um URL pré-assinado. Se o erro persistir depois de corrigir a rede ou o proxy, deve contactar o Suporte Sophos.

Nas integrações de coletores de registos de terceiros, os cartões em Integrations contabilizam Received, Filtered, Accepted e Uploaded. Estes contadores syslog não são o valor de carregamento do NDR nem o valor de captura SPAN. No entanto, são importantes porque uma integração de coletor de registos com carga elevada, executada na mesma appliance, consome CPU e Memory dessa appliance.

Avaliar a CPU, a Memory e o armazenamento

Em Status, o Appliance Manager apresenta a utilização de CPU, Memory, Root Disk e Data Disk. No NDR, é expectável que determinados núcleos da CPU estejam permanentemente com utilização máxima: o Data Plane Development Kit (DPDK) funciona em núcleos reservados no modo de consulta contínua. Nesses núcleos, procura continuamente pacotes em vez de aguardar interrupções quando está inativo.

A Sophos apresenta dois exemplos concretos:

  • Numa VM com 4 núcleos de CPU, um núcleo permanece a 100 %.
  • Numa VM com 8 núcleos de CPU, dois núcleos permanecem a 100 %.

Por conseguinte, este tipo de utilização por núcleo não comprova, por si só, uma sobrecarga e não desaparece necessariamente quando existe pouco tráfego. Inversamente, a afirmação «o DPDK é normal» não pode explicar todos os casos de utilização elevada da CPU. Torna-se crítica a combinação de tráfego crescente, outros núcleos com utilização máxima, a mensagem packets being dropped, carregamento em queda ou um histórico dos fluxos que se alterou face à linha de base.

Aplicam-se as seguintes orientações de capacidade às appliances virtuais:

Perfil de tráfegoLimite máximo documentadoDimensionamento
Mediumaté 500 Mbit/s, 70'000 pacotes/s e 1'200 fluxos/sPodem ser utilizadas as definições predefinidas da VM
Highaté 1 Gbit/s, 300'000 pacotes/s e 4'500 fluxos/sAumentar a VM para 8 vCPUs

As três métricas devem ser consideradas em conjunto. Um ambiente pode permanecer abaixo do limite de largura de banda e, ainda assim, gerar muitos pacotes por segundo devido a pacotes muito pequenos. Se os valores ultrapassarem o perfil High, a Sophos recomenda a utilização de várias appliances virtuais na rede.

Estes valores aplicam-se a uma VM que execute apenas o NDR. Sob carga elevada, cada integração adicional de coletor de registos alojada na appliance requer aproximadamente 400 MB de RAM e pode consumir capacidade adicional da CPU. Por este motivo, verifique também os cartões em Integrations antes de aumentar os recursos. Perante uma carga mista permanente, a separação por várias appliances pode ser mais adequada do que aumentar repetidamente os recursos da mesma VM.

Para a Memory, o Root Disk e o Data Disk, a documentação do produto utilizada neste artigo não especifica um limiar de aviso geral. Seria, por isso, enganador tratar uma percentagem arbitrária como um limite da Sophos. Os fatores decisivos são a tendência, a margem livre e os sintomas simultâneos. Se a utilização do disco aumentar continuamente, não elimine manualmente ficheiros nem contentores; comece por documentar o estado e o período e, se a causa não for clara, guarde os registos para o Suporte Sophos.

Criar uma linha de base útil

Uma captura instantânea não distingue a variação diária normal do início de uma sobrecarga. Após a colocação em funcionamento e depois de cada alteração relevante, registe, por isso, pontos de medição comparáveis:

  • data, hora e fuso horário, bem como a fase de carga esperada;
  • cor no Fusion e texto exato da mensagem;
  • valor de captura de cada porta SPAN configurada;
  • percentagem de carregamento e forma do histórico dos fluxos;
  • CPU por núcleo e visão global, Memory, Root Disk e Data Disk;
  • vCPUs e RAM atribuídas à VM;
  • valores estimados ou medidos no sistema de origem em Mbit/s, pacotes/s e fluxos/s;
  • integrações de terceiros executadas em simultâneo e respetiva atividade;
  • alterações ao switch, hipervisor, proxy, firewall ou appliance.

É útil efetuar medições num período calmo, com carga normal de atividade e durante um pico conhecido. O objetivo não é definir um valor-alvo universal, mas comparar a mesma appliance em condições semelhantes. Desta forma, uma queda súbita numa porta SPAN torna-se visível mesmo que o Fusion ainda apresente o estado verde. Após uma alteração de capacidade, só deve ser criada uma nova linha de base quando o estado estiver estável.

Resolver problemas por uma ordem segura

  1. Registar o âmbito: documente a appliance afetada, a porta SPAN, o início, o texto exato do Fusion e a última alteração. Antes de reiniciar, guarde capturas de ecrã ou valores medidos.
  2. Verificar a entrada: perante unhealthy span, fluxos em falta ou um desvio face ao valor de base da porta, verifique primeiro a origem do espelhamento, a porta de destino ou a interface de rede virtual e as redes esperadas. Adicionar CPU não corrige uma origem SPAN configurada incorretamente.
  3. Verificar o carregamento: perante um erro de carregamento para S3, verifique o acesso de saída à Internet, a firewall e o proxy Web. Inversamente, um carregamento bem-sucedido não corrige uma cobertura de espelhamento em falta.
  4. Verificar a capacidade: perante mais de 10 % de descartes, compare o perfil de tráfego, os restantes núcleos com utilização máxima, a atribuição de vCPUs e as integrações executadas na mesma appliance. Numa VM, atribua vCPUs adicionais; o perfil High documentado prevê 8 vCPUs. Com hardware certificado, pode ser instalada outra appliance e o tráfego SPAN pode ser dividido. Antes desta divisão, é obrigatório existir um plano de cobertura aprovado: este associa inequivocamente cada rede, VLAN e origem de espelhamento previstas à appliance de destino e evita lacunas e entradas duplicadas não intencionais. Perante cargas de trabalho mistas, o NDR e os Log Collectors podem ser distribuídos por appliances separadas.
  5. Delimitar o reinício: se o NDR continuar sem funcionar corretamente depois de corrigida a causa, pode ser considerado um reinício direcionado do NDR de acordo com as instruções de operação ou resolução de problemas aplicáveis. Durante esse período, não ocorre o processamento normal do NDR; um reinício não substitui uma correção de capacidade. Reiniciar ou encerrar toda a VM tem um âmbito de impacto maior e não deve fazer parte do primeiro passo da resolução de problemas.

Se as vCPUs ou a distribuição do tráfego forem alteradas, faça-o numa janela de manutenção aprovada e de acordo com as especificações da plataforma de virtualização utilizada. Efetue uma alteração de cada vez, para que o respetivo efeito permaneça mensurável. Depois de uma divisão do tráfego, verifique o plano de cobertura em relação a cada porta SPAN resultante; além disso, valide o percurso de teste ponto a ponto aprovado.

Não confundir a Investigation Console com a appliance NDR

A Investigation Console é um componente separado. O respetivo estado não comprova o estado da integração NDR, a integridade das origens SPAN nem a entrega bem-sucedida de dados. Por isso, este artigo limita-se a estabelecer esta distinção: o SPAN, o carregamento NDR, o DPDK e os Packet Drops são verificados na integração NDR e no Appliance Manager; a verificação e a resolução de problemas da Investigation Console pertencem à documentação de operações específica dessa consola.

Validar após cada medida

Repita a verificação sob uma carga comparável à da medição inicial. Uma correção só é considerada eficaz quando:

  • o Fusion apresenta o estado esperado sem a mensagem vermelha ou amarela anterior;
  • todas as portas SPAN esperadas estão visíveis e voltaram a corresponder ao respetivo histórico de base;
  • o classificador de unicast não foi utilizado incorretamente como comprovativo de cobertura;
  • a mensagem relativa a mais de 10 % de Packet Drops não volta a ocorrer;
  • o carregamento e os Network Flows permanecem estáveis durante um período de observação significativo;
  • a CPU fora dos núcleos DPDK esperados, a Memory, o Root Disk e o Data Disk apresentam margem suficiente;
  • as integrações de terceiros executadas na mesma appliance continuam a processar os dados esperados;
  • após uma divisão do tráfego, cada uma das redes, VLANs e origens de espelhamento previstas é encaminhada exatamente para a appliance designada, de acordo com o plano de cobertura aprovado, e o percurso de teste ponto a ponto aprovado funciona.

Estes controlos validam o estado operacional, mas ainda não uma cadeia de deteção completa. Para obter um comprovativo ponto a ponto, é também necessário um teste NDR aprovado com verificação da deteção resultante.

Quando deve intervir o Suporte Sophos

O Suporte Sophos deve ser envolvido se os contentores não ficarem prontos, se um erro de carregamento para S3 persistir apesar de o percurso de Internet e proxy ter sido confirmado, se uma porta SPAN permanecer unhealthy apesar de corrigida a configuração de origem, se os Packet Drops voltarem a ocorrer após um aumento adequado da capacidade ou se os recursos e as mensagens de estado forem contraditórios.

Para o escalamento, prepare pelo menos os seguintes dados:

  • nome da appliance, System ID, Version, K3S Helm Chart version e Uptime;
  • texto exato do estado e do erro, com início e fuso horário;
  • porta SPAN afetada, valores de captura/carregamento e histórico dos fluxos;
  • CPU por núcleo, Memory, Root Disk e Data Disk antes e depois da medida;
  • atribuição da VM, perfil de tráfego observado e integrações executadas na mesma appliance;
  • últimas alterações ao switch, hipervisor, firewall ou proxy;
  • medidas executadas e respetivo resultado mensurável;
  • em caso de problemas numa Investigation Console separada, os comprovativos exigidos pela respetiva documentação de operações.

As palavras-passe, chaves privadas e outros dados de acesso não devem ser incluídos no pedido de suporte. Não execute comandos Kubernetes de baixo nível nem alterações manuais em contentores com base em suspeitas; perante NDR containers not ready, recolha as observações existentes e coordene os passos seguintes com o Suporte Sophos.