Resilience360: Papíron működik, vagy élesben is kibírja a haváriát?

Van egy céges dokumentum, amit általában pontosan egyszer olvasnak el: amikor megírják. Ez a katasztrófa-helyreállítási terv. Ott van a mappában, megvan a pecsét és az aláírás, de vajon mi történik akkor, amikor a normál működés feltételeiből átlépünk egy éles havária helyzetbe? A DIG-IT Podcast legújabb adásában Személyi László a TC2 szakértőivel, Sepsi Károllyal (üzletfejlesztési vezető) és Kulcs Viktorral (felhőbiztonsági szakértő) járta körbe a felhős rendszerek ellenálló képességének kérdését.

Papírforma vagy valóság: Az RTO és RPO mint üzleti döntés

Sok cégvezető elvárja, hogy a rendszerek mindig hibátlanul működjenek, ám a stabil működés gyakran csak a normál körülményeknek köszönhető. A katasztrófa-helyreállítási mutatók, mint a visszaállítási idő (RTO – Recovery Time Objective) és a visszaállítási pont (RPO – Recovery Point Objective) valójában üzleti számok. A technikai megvalósítás előtt a cégvezetőknek, CFO-knak és CIO-knak kell meghatározniuk, hogy az egyes üzleti szolgáltatások kiesése pontosan mekkora pénzügyi, reputációs vagy szabályozói veszteséget jelent.

Ha minden zöld, valamit biztosan nem veszel észre

Kulcs Viktor kiemelte az „egészséges paranoia” fontosságát a biztonsági szakmában: ha a dashboard teljesen zöld, az csupán annyit jelent, hogy az általunk figyelt metrikák rendben vannak. Egy módosított elnevezési szabályzat (naming policy) vagy frissítési hiba miatt előfordulhat, hogy a riasztási lánc megszakad, és a kritikus jelzések el sem jutnak a felelősökhöz.

A reziliencia négy pillére és a felhős tesztelés

A TC2 által képviselt Resilience360 megközelítés négy fő pillérre épül: 1. **Obszervabilitás és monitoring**: A rendszer folyamatainak átláthatósága. 2. **Skálázódás**: A hatékony erőforrás-kihasználás biztosítása terhelés alatt. 3. **Terheléstesztelés**: A valós ügyfélkérések és terhelési hullámok szimulációja. 4. **Káosztesztelés (Chaos testing)**: Meghibásodások szándékos imitálása szoftver- vagy platformszinten. Az Amazon Web Services (AWS) felhőkörnyezetben ezek a tesztek könnyen lefolytathatók: egy tesztkörnyezet percek alatt éleshez hasonló szintre (production-like) skálázható, így a Game Day során munkaidőben, kontrollált keretek között lehet tesztelni a rendszer válaszlépéseit.

Mesterséges intelligencia és a humán kontroll egyensúlya

A kódelemzés és a beállítások felülvizsgálata során a TC2 mesterséges intelligenciát és specifikus prompt stratégiákat használ az adatok gyors strukturálására és a zaj kiszűrésére. Ugyanakkor a hallucinációk megelőzése érdekében minden megállapítást API-visszacsatolásokhoz kötnek, és a folyamat végén elengedhetetlen a szakértői felülvizsgálat (expert review) és az emberi ellenőrzés. Nézd meg a teljes beszélgetést a YouTube-on, és tudd meg, hogyan teheted ellenállóbbá saját informatikai rendszereidet: [DIG-IT Podcast epizód a YouTube-on](https://www.youtube.com/watch?v=WkMH8CA0Fks) Nezd meg a teljes epizodot a YouTube-on