O que é alta disponibilidade?
Em termos simples, Alta Disponibilidade (HA) é a capacidade de um serviço continuar operando apesar de falhas em seu ambiente. É possível alcançar a HA projetando um sistema sem nenhum ponto único de falha. Em um sistema de alta disponibilidade, as cargas de trabalho são distribuídas por um cluster de nós de servidor. Se um nó de servidor falhar, as cargas de trabalho em execução nele são automaticamente transferidas para outros servidores. Isso ajuda a garantir que aplicativos críticos continuem em execução mesmo quando ocorrem problemas em outras partes do sistema.
O principal objetivo da Alta Disponibilidade é minimizar o impacto que o tempo de inatividade e as interrupções têm nos processos de negócios de uma organização.
Um equívoco comum sobre a Alta Disponibilidade é que um sistema de TI estará disponível 24 horas por dia, 7 dias por semana. Mesmo no nível mais alto de HA, uma organização ainda deve se preparar para uma pequena porcentagem de tempo de inatividade planejado ou não planejado, o que um SLA geralmente define com “cinco noves” sendo o nível mais alto de disponibilidade.
Quanta Alta Disponibilidade você precisa?
Se você perguntasse às pessoas em que medida seus sistemas de TI deveriam estar protegidos contra tempo de inatividade, a resposta óbvia seria 24 horas por dia, 7 dias por semana, sempre disponíveis; no entanto, isso é incrivelmente desafiador e oneroso de se alcançar.
Antes que qualquer organização possa considerar uma estratégia de alta disponibilidade, é necessária uma análise adequada de impacto nos negócios para identificar os processos críticos e os riscos relacionados a paradas planejadas e não planejadas dos sistemas de TI interconectados.
Embora algumas organizações possam exigir o nível mais alto de disponibilidade, muitas não o fazem. Além disso, nem todos os serviços de TI são críticos para os negócios; portanto, pode ser mais aceitável e econômico para algumas organizações ter um SLA de alta disponibilidade de 99% em vez de 99,999%.
📓 Um exemplo simples poderia ser um supermercado que exige que seu sistema de pagamento online esteja disponível no mais alto nível de disponibilidade. O impacto de não ter esse serviço disponível pode resultar em prejuízo para a empresa, pois os clientes não poderão fazer compras se não tiverem dinheiro em mãos. O mesmo supermercado, no entanto, será menos afetado se o sistema de impressão na área administrativa ficar fora do ar por alguns minutos devido a uma interrupção planejada ou não planejada.
Determine os requisitos de alta disponibilidade com uma Análise de Impacto nos Negócios (BIA)
Antes de decidir por uma estratégia de alta disponibilidade, uma organização deve realizar uma análise de impacto nos negócios (BIA) para determinar a gravidade do impacto que interrupções e paralisações relacionadas à TI têm sobre os processos críticos de negócios e para identificar os requisitos necessários para garantir a continuidade das operações.
Uma análise de impacto nos negócios pode variar de organização para organização, mas geralmente abrange o seguinte:
-
Identifica processos de negócios críticos.
-
Calcula um risco mensurável de perda devido a interrupções e tempo de inatividade de TI.
-
Leva em consideração funções essenciais do negócio, pessoas e dependências comerciais.
-
Baseia-se em dados coletados por meio de entrevistas de BIA com os funcionários.
Em última análise, a BIA permitirá que a organização perceba como os negócios seriam afetados caso os processos de negócios fossem interrompidos durante interrupções ou tempo de inatividade dos sistemas de TI. Ela ajuda a organização a determinar quais processos de negócios são os mais críticos para a continuidade das operações e auxilia na elaboração de um plano de recuperação.
Principais Objetivos de Recuperação
Ao considerar a Alta Disponibilidade, há dois parâmetros-chave que definem por quanto tempo sua organização pode ficar offline e qual o nível de perda de dados que ela pode tolerar. Esses parâmetros são o Objetivo de Tempo de Recuperação (RTO) e o Objetivo de Ponto de Recuperação (RPO).
O Objetivo de Tempo de Recuperação (RTO) é definido como o tempo máximo necessário para que um sistema de TI, um conjunto de aplicativos etc. se recupere de uma paralisação (planejada, não planejada ou causada por um desastre) e retome as operações comerciais normais.
Os prazos de RTO são definidos no âmbito da Análise de Impacto nos Negócios (BIA) durante o planejamento de continuidade de negócios e de TI.
O Objetivo de Ponto de Recuperação (RPO) é uma medida da frequência com que você faz backups. Você pode arcar com a perda de um determinado número de minutos, horas ou dias de atualizações de dados caso ocorra um desastre entre os backups? O RPO indica quão recentes serão os dados restaurados.
Por exemplo, se ocorrer uma falha agora e seu último backup completo de dados tiver sido feito há 24 horas, o RPO é de 24 horas. Essencialmente, o RPO está relacionado à frequência dos backups, enquanto o RTO se refere ao tempo de recuperação.
Como medir a alta disponibilidade
A alta disponibilidade é medida pela porcentagem de tempo em que um serviço está disponível para os usuários, frequentemente expressa pelo número de “noves” nos dígitos. “Cinco noves” é usado para descrever a continuidade de um sistema de TI com 99,999% de tempo de atividade. Em outras palavras, o sistema ou serviço de TI fica indisponível por apenas 5,39 minutos ao longo do ano, devido a paradas planejadas ou não planejadas.
Alcançar cinco noves de alta disponibilidade ao longo do tempo é um desafio incrível. É caro devido aos custos operacionais da infraestrutura física de hardware e dos componentes de software, e componentes adicionais aumentam a complexidade e o risco. Para muitos serviços ou redes, três ou quatro noves seriam mais eficazes e justificados em relação aos recursos e custos envolvidos.