Início›Guias›O que fazer se…

O que fazer se…

Meu servidor caiu: o que fazer?

Um servidor fora do ar é tratado nesta ordem: entender a falha, saber se os dados ainda estão legíveis, escolher o último ponto de restauração íntegro, restaurar e só então decidir se esse servidor deveria ter tido uma contingência já pronta. Restaurar antes de identificar o ponto íntegro pode significar sobrescrever a única cópia ainda boa.

Atualizado em outubro de 20263 min de leitura5 fontes citadas

O essencial

  • Anote o horário e o sintoma antes de mexer em qualquer coisa: esse será o seu ponto de partida para escolher a cópia certa.
  • Várias máquinas afetadas ou arquivos renomeados em massa: é um ataque, não uma falha. Isole e siga o guia sobre ransomware.
  • Não religue repetidamente um servidor cujos discos fazem barulho: cada inicialização pode acabar de vez com um disco que está falhando.
  • Restaure a partir do último job bem-sucedido e anterior ao incidente, depois de abrir um arquivo de teste desse ponto.
  • Cronometre a retomada do serviço: esse é o seu RTO real.

1. Diagnosticar, sem desligar tudo às cegas

Anote o horário e o sintoma: nenhuma rede, tela azul, discos estalando, aplicativo que não abre, mensagem de criptografia.

  • Energia, switch, cabo. Um servidor “fora do ar” às vezes é apenas um link inativo. As outras máquinas respondem? O NAS responde?
  • Um único serviço. A máquina inicia, mas o aplicativo não. O prazo e a restauração não são os mesmos de um disco danificado.
  • Várias máquinas ao mesmo tempo, ou arquivos renomeados em massa. Trate isso como um ataque, não como uma falha de hardware: corte o acesso à internet da rede afetada, desconecte as máquinas atingidas sem desligá-las e siga para Um ransomware acabou de ser ativado. Não restaure em uma rede ainda comprometida.

Se o servidor físico estiver com cheiro de queimado ou os discos estiverem silenciosos e você não tiver cópia, pare de religá-lo repetidamente: cada inicialização pode agravar o estado de um disco que está falhando. A cópia de backup passa a ser a prioridade.

2. Determinar se os dados estão intactos

Três situações:

  • O sistema está inoperante, mas os discos de dados ainda respondem a partir de outra conexão ou de um live CD. É possível fazer uma cópia emergencial para um disco saudável e depois restaurar corretamente. Essa cópia emergencial não é motivo para dispensar o backup externo: ela pode estar incompleta.
  • Os arquivos estão lá e abrem. Falha de software ou falha parcial de hardware. Um reparo pode bastar. Faça backup do estado atual antes de tentar reparos destrutivos, se esse estado ainda estiver íntegro.
  • Os arquivos estão ilegíveis, ausentes ou criptografados. A produção deixou de ser uma fonte confiável. Apenas um backup anterior o é.

3. Identificar o último ponto de restauração

No console de backup, escolha o último job bem-sucedido e verifique se ele é anterior ao incidente. Se a falha for uma corrupção descoberta hoje, mas iniciada há uma semana, o job de ontem é um mau candidato. Abra um arquivo de teste desse ponto antes de iniciar a restauração completa.

Localize onde está a chave de criptografia. Sem ela, o ponto existe, mas continua ilegível.

4. Restaurar

  • Somente arquivos, se o sistema estiver íntegro e faltar apenas uma pasta.
  • Servidor inteiro, se o sistema estiver inoperante: imagem para um hardware equivalente ou para uma máquina virtual. É mais rápido do que uma reinstalação manual, desde que a imagem tenha sido testada pelo menos uma vez no ano.
  • Não restaure por cima de um disco que talvez contenha o único dado recente sem backup, enquanto essa dúvida não for esclarecida.

Se vários servidores precisarem ser reiniciados, respeite a ordem das dependências: diretório e rede primeiro, depois bancos de dados, depois aplicativos e, por fim, estações de trabalho. A ANSSI, agência nacional francesa de segurança cibernética, recomenda definir essa ordem de restauração com antecedência, levando em conta as dependências e a criticidade dos aplicativos.

Cronometre. Esse número é o seu RTO real.

5. Considerar um PRD se o servidor for crítico

Se a interrupção já custou caro demais, ou se não houver hardware de substituição, o PRD serve para reiniciar agora em uma instância de contingência, a partir do ponto escolhido, enquanto o hardware é reparado. Se esse servidor cai com frequência, ou se a diretoria não aceita mais esse prazo, ele deve entrar no PRD ou no PCN depois do incidente, por escrito, e não apenas em uma conversa informal no fim do dia.

O modo degradado (papel, outra ferramenta) é acionado em paralelo às etapas 3 e 4, não depois.

Após o incidente: o relatório

Na mesma semana, anote o que levou mais tempo do que o previsto, o que faltou (senha, chave, contato, hardware) e o que muda no plano. Se a causa for um ataque, preserve os rastros e os registros: a queixa deve ser registrada antes da reinstalação das máquinas, e uma violação de dados pessoais deve ser notificada à CNIL, a autoridade francesa de proteção de dados, em até 72 horas.

Na WeDoBack

A WeDoBack pode restaurar o servidor completo, com o sistema, os softwares e as configurações, ou apenas os arquivos. As cópias ficam fora do servidor com falha, criptografadas, com a chave em poder do cliente. Com o PRD, os servidores reiniciam em instâncias de contingência a partir da versão escolhida, sem esperar a compra de uma máquina; a ativação é cobrada por dia. O suporte atende pelo +33 9 72 50 78 28, das 9h às 13h e das 14h às 17h30 (horário de Paris). Fora desse horário, o monitoramento pode ter emitido um alerta, mas a restauração assistida aguarda a abertura do atendimento, salvo disposição contrária prevista em contrato.

Perguntas frequentes

Devo desligar o servidor?

Em caso de falha de hardware comprovada (cheiro de queimado, discos estalando), sim: pare de religá-lo. Se houver suspeita de ataque, isole-o da rede em vez de desligá-lo: a memória pode conter elementos úteis para a investigação, como lembra o Cybermalveillance.gouv.fr, o serviço público francês de assistência a vítimas de ataques cibernéticos.

Quanto tempo leva para restaurar um servidor?

Depende do volume, da largura de banda, do método (arquivos ou imagem completa) e da disponibilidade de um hardware de substituição. Sem uma imagem de sistema testada, conte muitas vezes de meio dia a dois dias para um servidor físico. Um PRD permite reiniciar em uma instância de contingência sem esperar pelo hardware.

É preciso avisar alguém além do prestador de serviços de TI?

Se a falha foi causada por um ataque e dados pessoais foram afetados, a violação deve ser notificada à CNIL, a autoridade francesa de proteção de dados, em até 72 horas (RGPD, artigo 33). Avise também a sua seguradora, se ela cobrir o risco cibernético, e registre uma queixa antes de reinstalar as máquinas.

Precisa de ajuda agora?

Não restaure nada antes de identificar uma cópia íntegra. Podemos orientar você.

Ligar para +33 9 72 50 78 28ou escreva para nós

Um incidente em andamento?

Nossas equipes ajudam você a identificar a cópia certa e a restaurar seus dados, de segunda a sexta-feira, das 9h às 13h e das 14h às 17h30 (horário de Paris).