Ηγέτες σκέψης

Ξεκινήστε την Προετοιμασία Τώρα για την Επόμενη Διακοπή Cloud

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Οι μεγάλες διακοπές cloud όπως αυτή της εβδομάδας από το AWS είναι αναπόφευκτες. Αυτές οι τέσσερις μεθόδους μπορούν να βοηθήσουν την εταιρεία σας να διατηρήσει την παραγωγικότητά της.

Με απίστευτες ώρες χαμένης παραγωγικότητας, το οικονομικό σύστημα διαταράχθηκε για εκατομμύρια χρηστών, και πιθανότατα εκατοντάδες δισεκατομμύρια δολάρια χαμένα, η διακοπή του AWS αυτή την εβδομάδα ήταν αναμφισβήτητα μια φριχτή μέρα για τις παγκόσμιες ομάδες IT. Φυσικά, ήταν επίσης η χειρότερη παγκόσμια καταστροφή cloud από την τελευταία… και μέχρι την επόμενη.

Ανεξάρτητα από το αν είστε στο AWS, GCP, Azure ή σε οποιαδήποτε άλλη πλατφόρμα, οι μεγάλες διακοπές είναι μια δεδομένη πραγματικότητα του cloud computing. Τι μπορεί να κάνει η εταιρεία σας για να μειώσει την επίδραση; Παρακάτω, θα προτείνω τέσσερα βήματα που η ομάδα σας μπορεί να thựcήσει αμέσως.

Φέρτε το σκεπτικισμό σας – και κάντε την εργασία σας.

Συχνά, οι ομάδες θα προσεγγίσουν την καταστροφή περπατώντας σε διαταραχές cloud με την υπόθεση ότι οι μεγάλες εταιρείες cloud είναι εγγενώς αξιόπιστες. Για να είμαστε σίγουροι, οι πιο αξιόπιστες εταιρείες έχουν κερδίσει τη φήμη τους για έναν λόγο. Ταυτόχρονα, κάθε cloud και hyperscaler προσφέρει eine ευρεία ποικιλία υποδομής – το AWS North America μόνο έχει 31 Availability Zones και 31 Edge Network Locations – και κάποιες επιλογές είναι πολύ πιο αξιόπιστες από τις άλλες.

Πράγματι, η περιοχή US-EAST-1 του AWS, η αιτία της διακοπής αυτή την εβδομάδα, είχε υποστεί μεγάλες διακοπές το 2020, 2021 και 2023, και ήταν γνωστό σε ορισμένα κύκλους IT ως η λιγότερο αξιόπιστη περιοχή. Πολλές εταιρείες πιθανότατα κατανόησαν την κατάσταση αλλά έπραξαν ένα υπολογισμένο ρίσκο λόγω του χαμηλού κόστους και των πολλών προσφερόμενων υπηρεσιών της περιοχής. Αλλά δεδομένης της έκτασης της διακοπής, είναι αδύνατο να μην σκεφτεί κανείς πόσες εταιρείες πάρθηκαν ολοσχερώς αιφνίδια – και θα είχαν σίγουρα επιλέξει τις πιο αξιόπιστες περιοχές αν είχαν γνώση των ανταλλαγμάτων. Έχω συναντήσει προσωπικά αρχηγούς IT που επέλεξαν να μετακινηθούν σε άλλες περιοχές του AWS μόνο μετά από κακές εμπειρίες με το US-EAST-1 στο παρελθόν.

Το μάθημα εδώ είναι να κάνετε την εργασία σας όταν πρόκειται για επιλογές υποδομής cloud, ανεξάρτητα από το ποια cloud χρησιμοποιείτε. Τόποι για να ξεκινήσετε περιλαμβάνουν δωρεάν εργαλεία όπως cloudprice, Cloudping, και οι ιστορικές απόψεις περιστατικών από εργαλεία Cloud Service Health που παρέχονται από hyperscalers.

Επιλέξτε portable αντί για cloud-φυσικό.

Όταν αρχιτεκτονείτε ρυθμίσεις cloud, ο απλούστερος δρόμος είναι να πάτε cloud-φυσικό. Αλλά ενώ είναι βολικό να επιλέξετε εφαρμογές που έχουν κατασκευαστεί από και για τον πάροχο cloud σας, αυτές οι cloud-φυσικές επιλογές σας αφήνουν πιο εκτεθειμένες αν ο cloud σας πάει κάτω.

Για να αποφύγετε这一 επιπλέον στρώμα εξάρτησης cloud, επιλέξτε ανεξάρτητες και/ή ανοικτού κώδικα προϊόντα όπου είναι δυνατό. Κάποιες επιλογές αντικατάστασης περιλαμβάνουν τις ακόλουθες:

Κατηγορία

Παράδειγμα Φυσικής Προσφοράς

Ανοικτές Εναλλακτικές Επιλογές Περιλαμβάνουν…

Αυθεντικοποίηση & Ταυτότητα

AWS Cognito

Keycloak

Αναζήτηση

Azure Monitor

Elasticsearch

Σχεσιακές Βάσεις Δεδομένων

Google Cloud SQL

PostgreSQL

NoSQL Βάσεις Δεδομένων

AWS DynamoDB

MongoDB

Διαχείριση Container

Azure Kubernetes Service (AKS)

Kubernetes

Παρακολούθηση & Παρατηρήσιμότητα

Google Cloud Monitoring

Prometheus + Grafana

Ουρές Μηνυμάτων

AWS SQS/SNS

Apache Kafka

Αποθήκευση Αντικειμένων

Azure Blob Storage

MinIO

Πύλη API

Google Cloud API Gateway

Kong

Για να είμαστε σίγουροι, η κατασκευή περισσότερου του cloud stack σας από την αρχή σημαίνει περισσότερη δουλειά για τις ομάδες σας. Ωστόσο, με την εμπειρία μου, μια φορά που έχετε την υποδομή σε λειτουργία, δεν υπάρχει σχεδόν καμία διαφορά μεταξύ της προσθήκης φόρτου εργασίας σε μια καθιερωμένη υποδομή ή της λειτουργίας σε μια cloud-φυσική μια. Και τα οφέλη σε σχέση με την ανθεκτικότητα – όχι μόνο η μείωση της εξάρτησης cloud – κάνουν τις ανεξάρτητες επιλογές εξαιρετικά αξιο đáng.

Μηχανική για αποτυχία.

Δεδομένου ότι οι διακοπές cloud θα συμβούν, βεβαιωθείτε ότι σχεδιάζετε τα προϊόντα σας με διακοπές cloud στο μυαλό. Ένα παράδειγμα να κοιτάξετε είναι η Datadog: σε ένα περιστατικό του 2023, η εταιρεία έχασε ξαφνικά την πρόσβαση σε πάνω από το μισό των κόμβων Kubernetes σε παραγωγή και ξανασχεδίασε完全 την προσέγγισή της για καταστροφές. Οι αλλαγές περιελάμβαναν την αφαίρεση αρχιτεκτονικών σφαλμάτων και την αντιμετώπιση του τεχνικού χρέους ώστε να μην προκαλούνται μερικές αποτυχίες στο σύστημα, τη βελτίωση της εισαγωγής και της αποθήκευσης δεδομένων για μεγαλύτερη διαθεσιμότητα δεδομένων κατά τη διάρκεια διακοπών, και την κατασκευή συστημάτων για αυτόματη ανάκτηση σε κλίμακα. Ένας εξαιρετικός τόπος για να ξεκινήσετε στο ταξίδι σας είναι να ακολουθήσετε την σύσταση της Datadog να “ξεκινήσετε με αυτό που είναι σημαντικό για τον τελικό χρήστη” και να κατασκευάσετε ασφαλείς για να προστατεύσετε αυτό που έχει σημασία περισσότερο.

Τρέξτε τουλάχιστον σε δύο clouds.

Φυσικά, ο καλύτερος τρόπος για να μην είστε υπόχρεοι σε διακοπές cloud είναι η αναπαραγωγή multicloud. Η επίτευξη αληθινής ροής multicloud είναι ένα τεράστιο έργο για πολλές εταιρείες,既然 είναι εξαιρετικά δύσκολο να μεταφράσετε την υποδομή από ένα cloud σε ένα άλλο. Αλλά η κατασκευή υποδομής σε δύο clouds είναι ένα ισχυρό – και συχνά δυνατό – σημείο να ξεκινήσετε. Κρίσιμο για να κάνετε这一 να λειτουργήσει είναι να έχετε μια ομάδα με έναν ειδικό σε κάθε cloud που τρέχετε.

Για να είμαστε σίγουροι, τίποτα δεν μπορεί να προστατεύσει完全 τις εταιρείες από την επίδραση μιας μεγάλης διακοπής όπως αυτή που είδαμε αυτή την εβδομάδα. Αλλά με την σωστή προετοιμασία, μια προσεγγιστική προσέγγιση cloud, μηχανική για αποτυχία, και χρησιμοποιώντας “δual-cloud” ως βήμα για αληθινή multicloud, οι εταιρείες μπορούν να είναι πολύ πιο ευέλικτες όταν η επόμενη (και δυστυχώς αναπόφευκτη) μεγάλη διακοπή cloud συμβεί.

Ο Harshit Omar είναι ο συνιδρυτής και τεχνικός διευθυντής της FluidCloud, όπου κατασκευάζει το μέλλον της υποδομής του cloud, ermögνοντας στις επιχειρήσεις να μεταναστεύουν, να αναπαράγουν και να βελτιστοποιούν τις εργασίες τους σε περιβάλλοντα multi-cloud. Προηγουμένως, ήταν ο πρώτος μηχανικός στην Accurics, όπου ηγήθηκε των βασικών εργασιών ανάπτυξης του μηχανισμού πολιτικής και της πλατφόρμας ασφάλειας cloud.

Με βαθιά εμπειρία σε Go, Kubernetes, Terraform και συμμόρφωση cloud, ο Harshit έχει περάσει πάνω από μια δεκαετία σχεδιάζοντας ανθεκτικά συστήματα σε AWS, Azure και GCP.

Ο στόχος του τώρα είναι να εξαλείψει την απαίτηση cloud lock-in και να κάνει την υποδομή τόσο φορητή και ανθεκτική όσο ο κώδικας.