Monitorizar o estado e a capacidade do Sophos NDR
Um estado verde do Sophos NDR é uma verificação intermédia importante, mas não comprova uma cobertura de espelhamento completa nem uma cadeia de deteção funcional. Para uma avaliação fiável, é necessário considerar separadamente seis grupos de sinais: Sophos Fusion, Appliance Manager, entrada SPAN, carregamento, processamento e armazenamento e, se existir, a Investigation Console autónoma.
Verificação rápida: comece por consultar o estado do NDR no Sophos Fusion. Em seguida, no Appliance Manager, em NDR, verifique os valores de cada porta SPAN esperada, Uploaded e o histórico dos fluxos. Em Status, verifique a CPU, a Memory, o Root Disk e o Data Disk. Um aviso amarelo spanX: packets being dropped significa que estão a ser descartados mais de 10 % dos pacotes de rede processados pelo NDR. Uma porta SPAN verde cumpre atualmente o classificador do produto de pelo menos 2 % de pacotes unicast. Nenhuma destas afirmações comprova, por si só, que todas as redes previstas estão a ser espelhadas ou que uma deteção chega ao fim da cadeia.
Associar corretamente os indicadores
| Sinal | Localização | O que comprova |
|---|---|---|
| Vermelho, amarelo ou verde | Sophos Fusion, integração NDR | Estado agregado da integração e mensagem de estado específica |
| NDR | Appliance Manager | Percentagem de carregamento, percentagem capturada por cada porta SPAN configurada e Network Flows em intervalos de 30 segundos |
| Status | Appliance Manager | Utilização de CPU, Memory, Root Disk e Data Disk da appliance |
| Integrations | Appliance Manager | Estado e contadores syslog das integrações de terceiros executadas na mesma appliance, não o tráfego SPAN do NDR |
| Investigation Console | Componente separado | O respetivo estado não comprova o estado da integração NDR nem a cobertura SPAN |
Abra o Appliance Manager no Sophos Fusion através de Threat Analysis Center > Integrations > Configured > Integration Appliances. Na linha da appliance, selecione os três pontos e depois Open Appliance Manager. A área do cabeçalho apresenta, entre outras informações, Version, K3S Helm Chart version, Uptime e System ID. Inclua estas informações em todos os registos de incidentes, pois duas appliances com sintomas aparentemente semelhantes podem ter versões de software ou tempos de atividade diferentes.
Utilizar o estado do Fusion como ponto de partida
O Sophos Fusion distingue três estados:
- Vermelho: a integração NDR não está a funcionar.
NDR containers not ready, <specific container names>indica aplicações que não estão prontas.Upload to s3 failed ...diz respeito ao carregamento para a cloud.spanX: unhealthy spandiz respeito à entrada de tráfego proveniente do dispositivo de rede que efetua o espelhamento. - Amarelo: a integração funciona, mas com erros.
spanX: packets being droppedé apresentado quando são descartados mais de 10 % dos pacotes de rede. - Verde: a integração está a receber tráfego SPAN e a processar dados de pacotes sem erros comunicados. Atualmente, uma porta SPAN é classificada como saudável se pelo menos 2 % dos pacotes observados forem pacotes unicast.
Os dois valores percentuais têm denominadores diferentes e não podem ser compensados entre si. O limiar de 2 % classifica a composição do tráfego que chega ao sensor. Não significa que 2 % de todo o tráfego da empresa seja suficiente, nem que o NDR possa perder 98 %. «Pelo menos 2 %» inclui exatamente 2 %. Em contrapartida, a mensagem relativa aos descartes descreve a proporção dos pacotes que já chegam ao NDR que o processamento não consegue tratar devido à falta de recursos. A Sophos documenta o aviso para mais de 10 %, não para «10 % ou mais».
Importante: o limiar de mais de 10 % é um estado do produto, não um valor-alvo nem um orçamento de perdas aceitável. Mesmo um valor inferior ao limiar de notificação pode representar uma degradação face à respetiva linha de base. Do mesmo modo, uma porta verde pode fornecer tráfego espelhado de forma incorreta ou incompleta, desde que a mistura observada cumpra o classificador de unicast.
Verificar separadamente a entrada SPAN e o carregamento
No Appliance Manager, o separador NDR apresenta um valor de captura para cada porta SPAN configurada. SPAN Port 2 só aparece se tiver sido configurada uma segunda porta. O gráfico global de Network Flows é apresentado em intervalos de 30 segundos.
Estes indicadores respondem a três perguntas distintas:
- Está a chegar tráfego a cada porta SPAN esperada? Um valor em falta ou subitamente muito diferente direciona primeiro a investigação para o switch de origem, a sessão de espelhamento ou SPAN, a atribuição da interface de rede virtual e as VLANs ou os grupos de portas alterados recentemente.
- A composição do tráfego é plausível? O verde confirma apenas o classificador de unicast atual. O histórico dos fluxos também tem de corresponder aos horários e locais habituais e aos picos de tráfego esperados.
- O NDR consegue processar os pacotes? A mensagem amarela relativa aos descartes indica um estrangulamento de processamento. Não é o mesmo que uma porta de espelhamento com excesso de subscrições ou perda de pacotes no percurso de produção.
A percentagem de carregamento, também visível no separador NDR, corresponde a uma etapa posterior. Uma entrada SPAN saudável com um carregamento em queda não indica a mesma categoria de falha que uma porta SPAN vazia. Perante Upload to s3 failed. Request was received but an error code was returned, verifique o acesso de saída à Internet da appliance, bem como as regras da firewall e do proxy Web. O NDR carrega os dados para um bucket S3 através de um URL pré-assinado. Se o erro persistir depois de corrigir a rede ou o proxy, deve contactar o Suporte Sophos.
Nas integrações de coletores de registos de terceiros, os cartões em Integrations contabilizam Received, Filtered, Accepted e Uploaded. Estes contadores syslog não são o valor de carregamento do NDR nem o valor de captura SPAN. No entanto, são importantes porque uma integração de coletor de registos com carga elevada, executada na mesma appliance, consome CPU e Memory dessa appliance.
Avaliar a CPU, a Memory e o armazenamento
Em Status, o Appliance Manager apresenta a utilização de CPU, Memory, Root Disk e Data Disk. No NDR, é expectável que determinados núcleos da CPU estejam permanentemente com utilização máxima: o Data Plane Development Kit (DPDK) funciona em núcleos reservados no modo de consulta contínua. Nesses núcleos, procura continuamente pacotes em vez de aguardar interrupções quando está inativo.
A Sophos apresenta dois exemplos concretos:
- Numa VM com 4 núcleos de CPU, um núcleo permanece a 100 %.
- Numa VM com 8 núcleos de CPU, dois núcleos permanecem a 100 %.
Por conseguinte, este tipo de utilização por núcleo não comprova, por si só, uma sobrecarga e não desaparece necessariamente quando existe pouco tráfego. Inversamente, a afirmação «o DPDK é normal» não pode explicar todos os casos de utilização elevada da CPU. Torna-se crítica a combinação de tráfego crescente, outros núcleos com utilização máxima, a mensagem packets being dropped, carregamento em queda ou um histórico dos fluxos que se alterou face à linha de base.
Aplicam-se as seguintes orientações de capacidade às appliances virtuais:
| Perfil de tráfego | Limite máximo documentado | Dimensionamento |
|---|---|---|
| Medium | até 500 Mbit/s, 70'000 pacotes/s e 1'200 fluxos/s | Podem ser utilizadas as definições predefinidas da VM |
| High | até 1 Gbit/s, 300'000 pacotes/s e 4'500 fluxos/s | Aumentar a VM para 8 vCPUs |
As três métricas devem ser consideradas em conjunto. Um ambiente pode permanecer abaixo do limite de largura de banda e, ainda assim, gerar muitos pacotes por segundo devido a pacotes muito pequenos. Se os valores ultrapassarem o perfil High, a Sophos recomenda a utilização de várias appliances virtuais na rede.
Estes valores aplicam-se a uma VM que execute apenas o NDR. Sob carga elevada, cada integração adicional de coletor de registos alojada na appliance requer aproximadamente 400 MB de RAM e pode consumir capacidade adicional da CPU. Por este motivo, verifique também os cartões em Integrations antes de aumentar os recursos. Perante uma carga mista permanente, a separação por várias appliances pode ser mais adequada do que aumentar repetidamente os recursos da mesma VM.
Para a Memory, o Root Disk e o Data Disk, a documentação do produto utilizada neste artigo não especifica um limiar de aviso geral. Seria, por isso, enganador tratar uma percentagem arbitrária como um limite da Sophos. Os fatores decisivos são a tendência, a margem livre e os sintomas simultâneos. Se a utilização do disco aumentar continuamente, não elimine manualmente ficheiros nem contentores; comece por documentar o estado e o período e, se a causa não for clara, guarde os registos para o Suporte Sophos.
Criar uma linha de base útil
Uma captura instantânea não distingue a variação diária normal do início de uma sobrecarga. Após a colocação em funcionamento e depois de cada alteração relevante, registe, por isso, pontos de medição comparáveis:
- data, hora e fuso horário, bem como a fase de carga esperada;
- cor no Fusion e texto exato da mensagem;
- valor de captura de cada porta SPAN configurada;
- percentagem de carregamento e forma do histórico dos fluxos;
- CPU por núcleo e visão global, Memory, Root Disk e Data Disk;
- vCPUs e RAM atribuídas à VM;
- valores estimados ou medidos no sistema de origem em Mbit/s, pacotes/s e fluxos/s;
- integrações de terceiros executadas em simultâneo e respetiva atividade;
- alterações ao switch, hipervisor, proxy, firewall ou appliance.
É útil efetuar medições num período calmo, com carga normal de atividade e durante um pico conhecido. O objetivo não é definir um valor-alvo universal, mas comparar a mesma appliance em condições semelhantes. Desta forma, uma queda súbita numa porta SPAN torna-se visível mesmo que o Fusion ainda apresente o estado verde. Após uma alteração de capacidade, só deve ser criada uma nova linha de base quando o estado estiver estável.
Resolver problemas por uma ordem segura
- Registar o âmbito: documente a appliance afetada, a porta SPAN, o início, o texto exato do Fusion e a última alteração. Antes de reiniciar, guarde capturas de ecrã ou valores medidos.
- Verificar a entrada: perante
unhealthy span, fluxos em falta ou um desvio face ao valor de base da porta, verifique primeiro a origem do espelhamento, a porta de destino ou a interface de rede virtual e as redes esperadas. Adicionar CPU não corrige uma origem SPAN configurada incorretamente. - Verificar o carregamento: perante um erro de carregamento para S3, verifique o acesso de saída à Internet, a firewall e o proxy Web. Inversamente, um carregamento bem-sucedido não corrige uma cobertura de espelhamento em falta.
- Verificar a capacidade: perante mais de 10 % de descartes, compare o perfil de tráfego, os restantes núcleos com utilização máxima, a atribuição de vCPUs e as integrações executadas na mesma appliance. Numa VM, atribua vCPUs adicionais; o perfil High documentado prevê 8 vCPUs. Com hardware certificado, pode ser instalada outra appliance e o tráfego SPAN pode ser dividido. Antes desta divisão, é obrigatório existir um plano de cobertura aprovado: este associa inequivocamente cada rede, VLAN e origem de espelhamento previstas à appliance de destino e evita lacunas e entradas duplicadas não intencionais. Perante cargas de trabalho mistas, o NDR e os Log Collectors podem ser distribuídos por appliances separadas.
- Delimitar o reinício: se o NDR continuar sem funcionar corretamente depois de corrigida a causa, pode ser considerado um reinício direcionado do NDR de acordo com as instruções de operação ou resolução de problemas aplicáveis. Durante esse período, não ocorre o processamento normal do NDR; um reinício não substitui uma correção de capacidade. Reiniciar ou encerrar toda a VM tem um âmbito de impacto maior e não deve fazer parte do primeiro passo da resolução de problemas.
Se as vCPUs ou a distribuição do tráfego forem alteradas, faça-o numa janela de manutenção aprovada e de acordo com as especificações da plataforma de virtualização utilizada. Efetue uma alteração de cada vez, para que o respetivo efeito permaneça mensurável. Depois de uma divisão do tráfego, verifique o plano de cobertura em relação a cada porta SPAN resultante; além disso, valide o percurso de teste ponto a ponto aprovado.
Não confundir a Investigation Console com a appliance NDR
A Investigation Console é um componente separado. O respetivo estado não comprova o estado da integração NDR, a integridade das origens SPAN nem a entrega bem-sucedida de dados. Por isso, este artigo limita-se a estabelecer esta distinção: o SPAN, o carregamento NDR, o DPDK e os Packet Drops são verificados na integração NDR e no Appliance Manager; a verificação e a resolução de problemas da Investigation Console pertencem à documentação de operações específica dessa consola.
Validar após cada medida
Repita a verificação sob uma carga comparável à da medição inicial. Uma correção só é considerada eficaz quando:
- o Fusion apresenta o estado esperado sem a mensagem vermelha ou amarela anterior;
- todas as portas SPAN esperadas estão visíveis e voltaram a corresponder ao respetivo histórico de base;
- o classificador de unicast não foi utilizado incorretamente como comprovativo de cobertura;
- a mensagem relativa a mais de 10 % de Packet Drops não volta a ocorrer;
- o carregamento e os Network Flows permanecem estáveis durante um período de observação significativo;
- a CPU fora dos núcleos DPDK esperados, a Memory, o Root Disk e o Data Disk apresentam margem suficiente;
- as integrações de terceiros executadas na mesma appliance continuam a processar os dados esperados;
- após uma divisão do tráfego, cada uma das redes, VLANs e origens de espelhamento previstas é encaminhada exatamente para a appliance designada, de acordo com o plano de cobertura aprovado, e o percurso de teste ponto a ponto aprovado funciona.
Estes controlos validam o estado operacional, mas ainda não uma cadeia de deteção completa. Para obter um comprovativo ponto a ponto, é também necessário um teste NDR aprovado com verificação da deteção resultante.
Quando deve intervir o Suporte Sophos
O Suporte Sophos deve ser envolvido se os contentores não ficarem prontos, se um erro de carregamento para S3 persistir apesar de o percurso de Internet e proxy ter sido confirmado, se uma porta SPAN permanecer unhealthy apesar de corrigida a configuração de origem, se os Packet Drops voltarem a ocorrer após um aumento adequado da capacidade ou se os recursos e as mensagens de estado forem contraditórios.
Para o escalamento, prepare pelo menos os seguintes dados:
- nome da appliance, System ID, Version, K3S Helm Chart version e Uptime;
- texto exato do estado e do erro, com início e fuso horário;
- porta SPAN afetada, valores de captura/carregamento e histórico dos fluxos;
- CPU por núcleo, Memory, Root Disk e Data Disk antes e depois da medida;
- atribuição da VM, perfil de tráfego observado e integrações executadas na mesma appliance;
- últimas alterações ao switch, hipervisor, firewall ou proxy;
- medidas executadas e respetivo resultado mensurável;
- em caso de problemas numa Investigation Console separada, os comprovativos exigidos pela respetiva documentação de operações.
As palavras-passe, chaves privadas e outros dados de acesso não devem ser incluídos no pedido de suporte. Não execute comandos Kubernetes de baixo nível nem alterações manuais em contentores com base em suspeitas; perante NDR containers not ready, recolha as observações existentes e coordene os passos seguintes com o Suporte Sophos.