Myslitelé

Začněte se připravovat na další cloudový výpadek

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Velké cloudové incidenty, jako ten, ke kterému došlo tento týden u AWS, jsou nevyhnutelné. Tyto čtyři metody mohou pomoci vaší firmě překonat následky.

S nesčetnými hodinami ztracené produktivity, finanční systémy byly narušeny pro miliony uživatelů, a potenciálně stovky miliard dolarů ztracených, tento týden výpadek AWS znamenal nepochybně špatný den pro globální IT týmy. Samozřejmě, že to byl také nejhorší globální cloudový katastrofický scénář od posledního… a až do příštího.

Bez ohledu na to, zda jste na AWS, GCP, Azure nebo na jiné platformě, velké výpadky jsou daní cloudového výpočetního prostředí. Co tedy může vaše firma udělat, aby zmírnila dopad? Níže nabízím čtyři kroky, které váš tým může okamžitě podniknout.

Přineste skepsi – a udělejte si domácí úkol.

Často týmy riskují katastrofu, když vstupují do cloudových dohod s předpokladem, že velké cloudové společnosti jsou samy o sobě spolehlivé. Je pravda, že nejvíce důvěryhodné firmy si zasloužily svou pověst. Současně však každý cloud a hyperscaler nabízí širokou škálu infrastrukturních možností – AWS Severní Amerika má 31 Availability Zones a 31 Edge Network Locations – a některé možnosti jsou mnohem spolehlivější než ostatní.

Skutečně, oblast AWS US-EAST-1, která byla příčinou tohoto týdne výpadku, byla za velkou narušení v roce 2020, 2021 a 2023, a bylo dlouho známo v určitých IT kruzích jako nejspolehlivější oblast. Mnoho firem pravděpodobně rozumělo situaci, ale vzalo kalkulované riziko s ohledem na nízkou cenu a bohaté nabídky. Ale s ohledem na rozsah výpadku je nemožné nepředpokládat, kolik firem bylo zcela překvapeno – a jistě by si vybralo spolehlivější oblasti, kdyby byli vědomi kompromisů. Osobně jsem setkal s IT lídry, kteří se rozhodli přesunout do jiných oblastí AWS pouze po špatných zkušenostech s US-EAST-1 v minulosti.

Lekce zde je, abyste udělali domácí úkol, pokud jde o cloudové infrastrukturní možnosti, bez ohledu na to, jaký cloud používáte. Místa, kde začít, zahrnují bezplatné nástroje, jako je cloudprice, Cloudping, a historické incidenty z hyperscaler-provided Cloud Service Health tools.

Vyberte přenositelnost nad cloud-nativní.

Když architektujete cloudové konfigurace, jednodušší cestou je jít cloud-nativní. Ale zatímco je pohodlné vybrat aplikace připravené cloudovým poskytovatelem, tyto cloud-nativní možnosti vás více vystavují, pokud váš cloud selže.

Abyste se vyhnuli této další vrstvě cloudové závislosti, zvolte nezávislé a/nebo open-source produkty, kde je to možné. Několik příkladů náhrad zahrnuje:

Kategorie

Příkladem nativní nabídky

Otevřené alternativy zahrnují…

Autentizace & Identita

AWS Cognito

Keycloak

Vyhledávání

Azure Monitor

Elasticsearch

Relační databáze

Google Cloud SQL

PostgreSQL

NoSQL databáze

AWS DynamoDB

MongoDB

Orchestrace kontejnerů

Azure Kubernetes Service (AKS)

Kubernetes

Monitorování & Observabilita

Google Cloud Monitoring

Prometheus + Grafana

Fronty zpráv

AWS SQS/SNS

Apache Kafka

Ukládání objektů

Azure Blob Storage

MinIO

Brána API

Google Cloud API Gateway

Kong

Je pravda, že stavba více cloudové struktury od základu znamená více práce pro vaše týmy. Nicméně, podle mé zkušenosti, jednou jste měli infrastrukturu nastavenou a běžící, je málo až žádný rozdíl mezi přidáním pracovní zátěže do zavedené domácí infrastruktury nebo do provozu na cloud-nativní. A výhody v oblasti odolnosti – nejenom snížení cloudové závislosti – činí nezávislé možnosti velmi užitečnými.

Navrhněte pro selhání.

Vzhledem k tomu, že cloudová selhání nastanou, ujistěte se, že navrhnete své produkty s ohledem na cloudové selhání. Jeden příklad, který je třeba prozkoumat, je Datadog: v roce 2023 firma náhle ztratila přístup k více než polovině svých Kubernetes uzlů v produkci a úplně přestavěla svůj přístup k katastrofám. Změny zahrnovaly odstranění architektonických úzkých míst a řešení technického dluhu, aby se částečná selhání nepřesunula skrze systém, zlepšení příjmu a ukládání dat pro větší dostupnost dat během výpadků a stavbu systémů pro automatické obnovení ve velkém měřítku. Jedno skvělé místo, kde začít, je následovat doporučení Datadog, aby se „začalo s tím, co je důležité pro koncového uživatele“, a postavit bezpečnostní prvky, aby se chránilo to, co je nejdůležitější.

Běžte na alespoň dvou cloudech.

Samozřejmě, že nejlepší způsob, jak se nevydat cloudovým selháním, je multicloudová redundance. Dosáhnout skutečné multicloudové plynulosti je obrovským úkolem pro mnoho firem, protože je extrémně obtížné přeložit infrastrukturu z jednoho cloudu do jiného. Ale stavba infrastruktury na dvou cloudech je silným – a často proveditelným – místem, kde začít. Kritickým faktorem pro úspěch je mít tým s odborníkem na každý cloud, na kterém běžíte.

Je pravda, že nic nemůže zcela ochránit firmy před dopadem masivního výpadku, jako byl ten, ke kterému došlo tento týden. Ale s řádnou péčí, cloud-portabilním přístupem, navrženým pro selhání a používáním „dual-cloudu“ jako mostu k opravdové multicloud, firmy mohou být mnohem pružnější, když nastane další (a bohužel nevyhnutelný) velký cloudový incident.

Harshit Omar je spoluzakladatel a technický ředitel FluidCloud, kde buduje budoucnost cloudové infrastruktury – umožňuje firmám bezproblémově migrovat, replikovat a optimalizovat úlohy v multi-cloud prostředí. Předtím byl prvním inženýrem v Accurics, kde vedl hlavní vývojové úsilí na jeho politickém motoru a cloudové bezpečnostní platformě.

S hlubokými znalostmi v Go, Kubernetes, Terraform a cloudové compliance strávil Harshit přes deset let navrhováním odolných systémů napříč AWS, Azure a GCP.

Jeho mise nyní spočívá v eliminaci cloudového lock-in a učinit infrastrukturu stejně portabilní a odolnou jako kód.