Dla kogo
Disaster Recovery Plan jest potrzebny firmom, dla których awaria infrastruktury, regionu chmurowego, bazy danych lub konta administracyjnego oznacza zatrzymanie kluczowego procesu. Nie każda organizacja potrzebuje aktywnego środowiska w dwóch regionach. Każda powinna jednak wiedzieć, co odtwarza jako pierwsze, kto podejmuje decyzję i ile przestoju może zaakceptować.
Backup, Disaster Recovery i Business Continuity nie są tym samym. Backup zabezpiecza dane. DR opisuje przywrócenie systemów technologicznych. Business Continuity obejmuje również ludzi, komunikację, procesy ręczne i obsługę klientów podczas awarii.
Jak policzyć koszt przestoju
Punktem wyjścia jest koszt jednej godziny niedostępności. W uproszczeniu można połączyć:
- utracony przychód lub liczbę niewykonanych transakcji,
- koszt pracy osób, które nie mogą realizować zadań,
- koszt obsługi zgłoszeń i komunikacji kryzysowej,
- kary umowne lub naruszenie SLA,
- koszt ręcznego odtworzenia i weryfikacji danych,
- ryzyko utraty klientów po dłuższej awarii.
Nie wszystkie systemy mają tę samą wartość. Strona informacyjna może poczekać kilka godzin, podczas gdy baza zamówień lub panel klienta wymaga znacznie szybszej reakcji. Dlatego DR zaczyna się od klasyfikacji usług i zależności, a nie od zakupu kolejnego narzędzia.
Poziomy DR (minimum, standard, krytyczny)
Poziom minimalny obejmuje sprawdzony backup, dokumentację infrastruktury, listę kontaktów i procedurę ręcznego odtworzenia. Jest odpowiedni, gdy firma może zaakceptować dłuższy przestój.
Poziom standardowy dodaje automatyzację infrastruktury, regularne testy, replikację wybranych danych oraz przygotowane środowisko odtworzeniowe. Skraca czas powrotu bez utrzymywania pełnej kopii systemu przez cały czas.
Poziom krytyczny może wymagać wielu stref lub regionów, automatycznego przełączenia, stałej replikacji i dyżuru operacyjnego. Taki model ma najwyższy koszt i powinien być uzasadniony wartością chronionego procesu.
Plan testów i odpowiedzialności
Dobry plan DR zawiera co najmniej:
- mapę systemów i ich zależności,
- przypisane RPO i RTO dla najważniejszych usług,
- kolejność odtwarzania komponentów,
- właścicieli technicznych i biznesowych,
- sposób komunikacji wewnętrznej i z klientami,
- kryteria ogłoszenia awarii oraz zakończenia trybu DR,
- harmonogram testów i miejsce zapisywania wyników.
Pierwszy test zwykle ujawnia brakujące dostępy, nieaktualne adresy, zależność od jednej osoby albo zbyt optymistyczny czas odtworzenia. To normalny i wartościowy wynik. Plan powinien być aktualizowany po każdym teście oraz po większej zmianie architektury.
Budżet roczny DR
Koszt planu DR zależy przede wszystkim od oczekiwanego RTO, ilości danych, liczby systemów, stopnia automatyzacji i częstotliwości testów. Im krótszy dopuszczalny przestój, tym więcej zasobów trzeba utrzymywać w gotowości.
W budżecie należy uwzględnić nie tylko przygotowanie dokumentu, ale też:
- przestrzeń i transfer dla kopii,
- zapasową infrastrukturę lub możliwość jej szybkiego utworzenia,
- narzędzia do replikacji i monitoringu,
- czas zespołu podczas testów,
- aktualizację automatyzacji oraz dokumentacji,
- obsługę incydentów i ewentualne dyżury.
Realistyczny harmonogram dla standardowego środowiska to zwykle od 2 do 8 tygodni na analizę, przygotowanie procedur, wdrożenie brakujących elementów i pierwszy test. Najpierw warto wykonać audyt oraz ustalić priorytety, a dopiero później wybierać kosztowne mechanizmy wysokiej dostępności.