Vordenker
Bereiten Sie sich jetzt auf den nächsten Cloud-Ausfall vor

Große Cloud-Vorfälle wie der in dieser Woche von AWS sind unvermeidlich. Diese vier Methoden können Ihrem Unternehmen helfen, den Schlag abzumildern.
Mit unzähligen Stunden verlorener Produktivität, Finanzsysteme, die für Millionen von Benutzern gestört wurden, und möglicherweise hunderte von Milliarden Dollar verloren, war der Cloud-Ausfall von AWS in dieser Woche ein unbestreitbar schlechter Tag für globale IT-Teams. Natürlich war es auch die schlimmste globale Cloud-Katastrophe seit dem letzten Mal… und bis zum nächsten Mal.
Egal, ob Sie auf AWS, GCP, Azure oder einer anderen Plattform sind, große Ausfälle sind ein Teil der Cloud-Computing-Realität. Was also kann Ihr Unternehmen tun, um den Schlag abzumildern? Unten werde ich vier Schritte vorstellen, die Ihr Team sofort unternehmen kann.
Seien Sie skeptisch – und machen Sie Ihre Hausaufgaben.
Oftmals gehen Teams das Risiko ein, in Cloud-Vereinbarungen zu treten, indem sie annehmen, dass große Cloud-Unternehmen von Natur aus zuverlässig sind. Sicherlich haben die renommiertesten Unternehmen ihre Reputation aus einem Grund verdient. Gleichzeitig bieten alle Cloud- und Hyperscaler-Anbieter eine breite Palette von Infrastruktur-Optionen – AWS Nordamerika allein hat 31 Verfügbarkeitszonen und 31 Edge-Netzwerkstandorte – und einige Optionen sind wesentlich zuverlässiger als andere.
Tatsächlich war die US-EAST-1-Region von AWS, die Ursache des Ausfalls in dieser Woche, hinter großen Störungen in den Jahren 2020, 2021 und 2023 und war in bestimmten IT-Kreisen als die zuverlässigste Region bekannt als die zuverlässigste Region. Viele Unternehmen haben wahrscheinlich die Situation verstanden, aber ein kalkuliertes Risiko eingegangen, da die Region niedrige Kosten und reichlich Angebote hatte. Aber angesichts des Umfangs des Ausfalls ist es unmöglich, nicht zu überlegen, wie viele Unternehmen völlig überrascht wurden – und sicherlich für die zuverlässigeren Regionen optiert hätten, wenn sie sich der Kompromisse bewusst gewesen wären. Ich habe persönlich IT-Führungskräfte getroffen, die sich entschieden, in andere AWS-Regionen zu wechseln, nachdem sie schlechte Erfahrungen mit US-EAST-1 gemacht hatten.
Die Lektion hier ist, Ihre Hausaufgaben zu machen, wenn es um Cloud-Infrastruktur-Optionen geht, egal auf welcher Cloud Sie arbeiten. Ein guter Ausgangspunkt sind kostenlose Tools wie cloudprice, Cloudping und die historischen Incident-Ansichten von Cloud Service Health-Tools.
Wählen Sie portabel anstelle von cloud-nativ.
Wenn Sie Cloud-Konfigurationen entwerfen, ist der einfachere Weg, cloud-nativ zu gehen. Aber während es bequem ist, Anwendungen auszuwählen, die von und für Ihren Cloud-Anbieter erstellt wurden, lassen diese cloud-nativen Optionen Sie anfälliger für Cloud-Ausfälle.
Um diese zusätzliche Schicht von Cloud-Abhängigkeit zu vermeiden, wählen Sie unabhängige und/oder Open-Source-Produkte, wo immer möglich. Einige Beispiele für Ersatzprodukte sind die folgenden:
|
Kategorie |
Native-Angebot-Beispiel |
Open-Source-Alternativen umfassen… |
|
Authentifizierung und Identität |
AWS Cognito |
Keycloak |
|
Suche |
Azure Monitor |
Elasticsearch |
|
Relationale Datenbanken |
Google Cloud SQL |
PostgreSQL |
|
NoSQL-Datenbanken |
AWS DynamoDB |
MongoDB |
|
Container-Orchestrierung |
Azure Kubernetes Service (AKS) |
Kubernetes |
|
Überwachung und Beobachtbarkeit |
Google Cloud Monitoring |
Prometheus + Grafana |
|
Nachrichtenwarteschlangen |
AWS SQS/SNS |
Apache Kafka |
|
Objektspeicher |
Azure Blob Storage |
MinIO |
|
API-Gateway |
Google Cloud API Gateway |
Kong |
Sicherlich bedeutet es, mehr von Ihrem Cloud-Stack von Grund auf aufzubauen, mehr Arbeit für Ihre Teams. Aber in meiner Erfahrung gibt es, sobald die Infrastruktur aufgebaut und in Betrieb ist, wenig bis gar keinen Unterschied zwischen der Hinzufügung von Workloads zu einer etablierten, selbst erstellten Infrastruktur oder der Ausführung auf einer cloud-nativen Infrastruktur. Und die Vorteile in Bezug auf Widerstandsfähigkeit – nicht zu erwähnen, die verringerte Cloud-Abhängigkeit – machen unabhängige Optionen sehr wertvoll.
Entwerfen Sie für den Ausfall.
Da Cloud-Ausfälle auftreten werden, sollten Sie Ihre Produkte so entwerfen, dass sie Cloud-Ausfälle berücksichtigen. Ein Beispiel, das Sie sich ansehen können, ist Datadog: In einem Vorfall im Jahr 2023 verlor das Unternehmen plötzlich den Zugriff auf über die Hälfte seiner Kubernetes-Knoten in der Produktion und entwarf seine Katastrophen-Strategie vollständig neu. Zu den Änderungen gehörten die Beseitigung von architektonischen Engpässen und die Bekämpfung von technischem Schulden, damit Teilausfälle nicht durch das System hindurchschlagen, die Verbesserung der Datenübernahme und -speicherung für eine größere Datenverfügbarkeit während Ausfällen und den Bau von Systemen, die automatisch im großen Maßstab wiederhergestellt werden können. Ein guter Ausgangspunkt für Ihre Reise ist es, Datadogs Empfehlung zu folgen, “mit dem zu beginnen, was für den Endbenutzer wichtig ist”, und Sicherungen zu erstellen, um das zu schützen, was am meisten zählt.
Führen Sie auf mindestens zwei Clouds aus.
Natürlich ist die beste Möglichkeit, nicht von Cloud-Ausfällen abhängig zu sein, die Multicloud-Redundanz. Die Erreichung einer echten Multicloud-Flüssigkeit ist für viele Unternehmen ein enormes Unterfangen, da es extrem schwierig ist, Infrastruktur von einer Cloud in eine andere zu übertragen. Aber die Aufbau von Infrastruktur auf nur zwei Clouds ist ein starker – und oft machbarer – Ausgangspunkt. Wichtig, um dies zu erreichen, ist es, ein Team mit einem Experten für jede der Clouds, auf denen Sie ausgeführt werden, zu haben.
Sicherlich kann nichts Unternehmen vollständig vor dem Ausfall eines großen Cloud-Ausfalls wie dem in dieser Woche schützen. Aber mit der richtigen Sorgfalt, einem cloud-portablen Ansatz, der Berücksichtigung von Cloud-Ausfällen und der Verwendung von “Dual-Cloud” als Schrittstein für echte Multicloud können Unternehmen viel agiler sein, wenn der nächste (und leider unvermeidliche) große Cloud-Vorfall eintritt.












