Dla kogo
Utrzymanie DevOps w abonamencie sprawdza się, gdy firma ma już działającą aplikację lub infrastrukturę, ale nie potrzebuje pełnego etatu SRE albo DevOps. Najczęściej dotyczy to zespołów po pierwszym wdrożeniu do chmury, e-commerce zależnego od dostępności sklepu oraz SaaS, w którym awaria bezpośrednio wpływa na klientów.
Abonament nie powinien być jednak workiem anonimowych godzin. Dobra usługa opisuje, kto reaguje, na jakie zdarzenia, w jakim czasie i gdzie kończy się utrzymanie, a zaczyna rozwój. Przed podpisaniem umowy warto poprosić o przykładowy raport miesięczny, procedurę obsługi incydentu oraz listę elementów objętych monitoringiem.
Minimalny zakres utrzymania
Podstawowy pakiet powinien obejmować co najmniej:
- monitoring infrastruktury i najważniejszych funkcji aplikacji, a nie tylko informację, czy serwer odpowiada,
- alerty z ustalonym priorytetem, właścicielem i kanałem eskalacji,
- kontrolę wykonania backupu oraz okresowy test odtworzenia,
- aktualizacje bezpieczeństwa, przegląd dostępów i reakcję na krytyczne podatności,
- wsparcie procesu wdrożeń, pipeline CI/CD i bezpieczny rollback,
- dokumentację operacyjną, listę kontaktów oraz aktualne runbooki,
- okresowy przegląd kosztów chmury i rekomendacje optymalizacyjne.
Sam monitoring bez procedury reakcji ma małą wartość. Alert powinien prowadzić do konkretnego działania: potwierdzenia incydentu, diagnozy, ograniczenia skutków, przywrócenia usługi i krótkiego podsumowania przyczyny.
Jak czytać SLA i odpowiedzialność dostawcy
SLA należy czytać razem z definicją priorytetów. Czas reakcji oznacza zwykle rozpoczęcie pracy, a nie usunięcie awarii. W umowie powinno być jasno zapisane, co oznacza incydent krytyczny, jakie są godziny wsparcia, kto może zgłosić problem i jak wygląda eskalacja poza standardowym kanałem.
Warto rozdzielić trzy pojęcia:
- czas reakcji - kiedy ktoś potwierdzi zgłoszenie i zacznie diagnozę,
- czas przywrócenia - kiedy usługa wróci do działania, nawet w trybie awaryjnym,
- czas rozwiązania - kiedy usunięta zostanie właściwa przyczyna problemu.
Dyżury 24/7 mają sens dla systemów, których przestój generuje realną stratę. Dla mniej krytycznej strony firmowej lepszy może być pakiet w godzinach roboczych z dobrym monitoringiem i jasną ścieżką awaryjną.
Typowe modele cenowe
Najprostszy model to stały abonament z określonym zakresem operacyjnym oraz osobną pulą na większe zmiany. Dla mniejszych środowisk punkt wejścia może zaczynać się od około 2400 PLN miesięcznie. Pakiet z SLA, rozwojem CI/CD, regularnym przeglądem bezpieczeństwa i optymalizacją kosztów zwykle wymaga większego zakresu i zaczyna się od około 4800 PLN miesięcznie.
Na cenę najmocniej wpływają liczba środowisk, krytyczność systemu, wymagane godziny wsparcia, jakość obecnej dokumentacji i stopień automatyzacji. Najtańsza oferta może okazać się kosztowna, jeśli nie obejmuje odtworzenia backupu, aktualizacji bezpieczeństwa albo reakcji na alerty.
KPI, które warto monitorować miesięcznie
Raport utrzymaniowy powinien pokazywać trend, a nie tylko listę wykonanych zadań. Przydatne wskaźniki to:
- liczba incydentów z podziałem na priorytety,
- średni czas wykrycia i przywrócenia usługi,
- skuteczność backupu oraz wynik ostatniego testu restore,
- liczba nieudanych wdrożeń i rollbacków,
- dostępność najważniejszych usług,
- krytyczne podatności i status ich usunięcia,
- zmiana kosztu chmury wraz z wyjaśnieniem anomalii.
Jeżeli raport przez kilka miesięcy ogranicza się do stwierdzenia „wszystko działa”, trudno ocenić realną wartość usługi. Dobry partner pokazuje ryzyka, wykonane usprawnienia i priorytety na kolejny okres.
Pytania przed wyborem dostawcy
- Jak wygląda reakcja na alert poza godzinami pracy?
- Kto odpowiada za test odtworzenia backupu?
- Czy większe zmiany są częścią abonamentu, czy osobnym projektem?
- Jak często otrzymamy raport i rekomendacje?
- Co dzieje się po przekroczeniu ustalonej puli pracy?
- W jaki sposób dostawca dokumentuje zmiany i przekazuje wiedzę zespołowi?