Myslitelé
Začněte se připravovat na další cloudový výpadek

Velké cloudové incidenty, jako ten, ke kterému došlo tento týden u AWS, jsou nevyhnutelné. Tyto čtyři metody mohou pomoci vaší firmě překonat následky.
S nesčetnými hodinami ztracené produktivity, finanční systémy byly narušeny pro miliony uživatelů, a potenciálně stovky miliard dolarů ztracených, tento týden výpadek AWS znamenal nepochybně špatný den pro globální IT týmy. Samozřejmě, že to byl také nejhorší globální cloudový katastrofický scénář od posledního… a až do příštího.
Bez ohledu na to, zda jste na AWS, GCP, Azure nebo na jiné platformě, velké výpadky jsou daní cloudového výpočetního prostředí. Co tedy může vaše firma udělat, aby zmírnila dopad? Níže nabízím čtyři kroky, které váš tým může okamžitě podniknout.
Přineste skepsi – a udělejte si domácí úkol.
Často týmy riskují katastrofu, když vstupují do cloudových dohod s předpokladem, že velké cloudové společnosti jsou samy o sobě spolehlivé. Je pravda, že nejvíce důvěryhodné firmy si zasloužily svou pověst. Současně však každý cloud a hyperscaler nabízí širokou škálu infrastrukturních možností – AWS Severní Amerika má 31 Availability Zones a 31 Edge Network Locations – a některé možnosti jsou mnohem spolehlivější než ostatní.
Skutečně, oblast AWS US-EAST-1, která byla příčinou tohoto týdne výpadku, byla za velkou narušení v roce 2020, 2021 a 2023, a bylo dlouho známo v určitých IT kruzích jako nejspolehlivější oblast. Mnoho firem pravděpodobně rozumělo situaci, ale vzalo kalkulované riziko s ohledem na nízkou cenu a bohaté nabídky. Ale s ohledem na rozsah výpadku je nemožné nepředpokládat, kolik firem bylo zcela překvapeno – a jistě by si vybralo spolehlivější oblasti, kdyby byli vědomi kompromisů. Osobně jsem setkal s IT lídry, kteří se rozhodli přesunout do jiných oblastí AWS pouze po špatných zkušenostech s US-EAST-1 v minulosti.
Lekce zde je, abyste udělali domácí úkol, pokud jde o cloudové infrastrukturní možnosti, bez ohledu na to, jaký cloud používáte. Místa, kde začít, zahrnují bezplatné nástroje, jako je cloudprice, Cloudping, a historické incidenty z hyperscaler-provided Cloud Service Health tools.
Vyberte přenositelnost nad cloud-nativní.
Když architektujete cloudové konfigurace, jednodušší cestou je jít cloud-nativní. Ale zatímco je pohodlné vybrat aplikace připravené cloudovým poskytovatelem, tyto cloud-nativní možnosti vás více vystavují, pokud váš cloud selže.
Abyste se vyhnuli této další vrstvě cloudové závislosti, zvolte nezávislé a/nebo open-source produkty, kde je to možné. Několik příkladů náhrad zahrnuje:
|
Kategorie |
Příkladem nativní nabídky |
Otevřené alternativy zahrnují… |
|
Autentizace & Identita |
AWS Cognito |
Keycloak |
|
Vyhledávání |
Azure Monitor |
Elasticsearch |
|
Relační databáze |
Google Cloud SQL |
PostgreSQL |
|
NoSQL databáze |
AWS DynamoDB |
MongoDB |
|
Orchestrace kontejnerů |
Azure Kubernetes Service (AKS) |
Kubernetes |
|
Monitorování & Observabilita |
Google Cloud Monitoring |
Prometheus + Grafana |
|
Fronty zpráv |
AWS SQS/SNS |
Apache Kafka |
|
Ukládání objektů |
Azure Blob Storage |
MinIO |
|
Brána API |
Google Cloud API Gateway |
Kong |
Je pravda, že stavba více cloudové struktury od základu znamená více práce pro vaše týmy. Nicméně, podle mé zkušenosti, jednou jste měli infrastrukturu nastavenou a běžící, je málo až žádný rozdíl mezi přidáním pracovní zátěže do zavedené domácí infrastruktury nebo do provozu na cloud-nativní. A výhody v oblasti odolnosti – nejenom snížení cloudové závislosti – činí nezávislé možnosti velmi užitečnými.
Navrhněte pro selhání.
Vzhledem k tomu, že cloudová selhání nastanou, ujistěte se, že navrhnete své produkty s ohledem na cloudové selhání. Jeden příklad, který je třeba prozkoumat, je Datadog: v roce 2023 firma náhle ztratila přístup k více než polovině svých Kubernetes uzlů v produkci a úplně přestavěla svůj přístup k katastrofám. Změny zahrnovaly odstranění architektonických úzkých míst a řešení technického dluhu, aby se částečná selhání nepřesunula skrze systém, zlepšení příjmu a ukládání dat pro větší dostupnost dat během výpadků a stavbu systémů pro automatické obnovení ve velkém měřítku. Jedno skvělé místo, kde začít, je následovat doporučení Datadog, aby se „začalo s tím, co je důležité pro koncového uživatele“, a postavit bezpečnostní prvky, aby se chránilo to, co je nejdůležitější.
Běžte na alespoň dvou cloudech.
Samozřejmě, že nejlepší způsob, jak se nevydat cloudovým selháním, je multicloudová redundance. Dosáhnout skutečné multicloudové plynulosti je obrovským úkolem pro mnoho firem, protože je extrémně obtížné přeložit infrastrukturu z jednoho cloudu do jiného. Ale stavba infrastruktury na dvou cloudech je silným – a často proveditelným – místem, kde začít. Kritickým faktorem pro úspěch je mít tým s odborníkem na každý cloud, na kterém běžíte.
Je pravda, že nic nemůže zcela ochránit firmy před dopadem masivního výpadku, jako byl ten, ke kterému došlo tento týden. Ale s řádnou péčí, cloud-portabilním přístupem, navrženým pro selhání a používáním „dual-cloudu“ jako mostu k opravdové multicloud, firmy mohou být mnohem pružnější, když nastane další (a bohužel nevyhnutelný) velký cloudový incident.












