Ηγέτες σκέψης
Ξεκινήστε την Προετοιμασία Τώρα για την Επόμενη Διακοπή Cloud

Οι μεγάλες διακοπές cloud όπως αυτή της εβδομάδας από το AWS είναι αναπόφευκτες. Αυτές οι τέσσερις μεθόδους μπορούν να βοηθήσουν την εταιρεία σας να διατηρήσει την παραγωγικότητά της.
Με απίστευτες ώρες χαμένης παραγωγικότητας, το οικονομικό σύστημα διαταράχθηκε για εκατομμύρια χρηστών, και πιθανότατα εκατοντάδες δισεκατομμύρια δολάρια χαμένα, η διακοπή του AWS αυτή την εβδομάδα ήταν αναμφισβήτητα μια φριχτή μέρα για τις παγκόσμιες ομάδες IT. Φυσικά, ήταν επίσης η χειρότερη παγκόσμια καταστροφή cloud από την τελευταία… και μέχρι την επόμενη.
Ανεξάρτητα από το αν είστε στο AWS, GCP, Azure ή σε οποιαδήποτε άλλη πλατφόρμα, οι μεγάλες διακοπές είναι μια δεδομένη πραγματικότητα του cloud computing. Τι μπορεί να κάνει η εταιρεία σας για να μειώσει την επίδραση; Παρακάτω, θα προτείνω τέσσερα βήματα που η ομάδα σας μπορεί να thựcήσει αμέσως.
Φέρτε το σκεπτικισμό σας – και κάντε την εργασία σας.
Συχνά, οι ομάδες θα προσεγγίσουν την καταστροφή περπατώντας σε διαταραχές cloud με την υπόθεση ότι οι μεγάλες εταιρείες cloud είναι εγγενώς αξιόπιστες. Για να είμαστε σίγουροι, οι πιο αξιόπιστες εταιρείες έχουν κερδίσει τη φήμη τους για έναν λόγο. Ταυτόχρονα, κάθε cloud και hyperscaler προσφέρει eine ευρεία ποικιλία υποδομής – το AWS North America μόνο έχει 31 Availability Zones και 31 Edge Network Locations – και κάποιες επιλογές είναι πολύ πιο αξιόπιστες από τις άλλες.
Πράγματι, η περιοχή US-EAST-1 του AWS, η αιτία της διακοπής αυτή την εβδομάδα, είχε υποστεί μεγάλες διακοπές το 2020, 2021 και 2023, και ήταν γνωστό σε ορισμένα κύκλους IT ως η λιγότερο αξιόπιστη περιοχή. Πολλές εταιρείες πιθανότατα κατανόησαν την κατάσταση αλλά έπραξαν ένα υπολογισμένο ρίσκο λόγω του χαμηλού κόστους και των πολλών προσφερόμενων υπηρεσιών της περιοχής. Αλλά δεδομένης της έκτασης της διακοπής, είναι αδύνατο να μην σκεφτεί κανείς πόσες εταιρείες πάρθηκαν ολοσχερώς αιφνίδια – και θα είχαν σίγουρα επιλέξει τις πιο αξιόπιστες περιοχές αν είχαν γνώση των ανταλλαγμάτων. Έχω συναντήσει προσωπικά αρχηγούς IT που επέλεξαν να μετακινηθούν σε άλλες περιοχές του AWS μόνο μετά από κακές εμπειρίες με το US-EAST-1 στο παρελθόν.
Το μάθημα εδώ είναι να κάνετε την εργασία σας όταν πρόκειται για επιλογές υποδομής cloud, ανεξάρτητα από το ποια cloud χρησιμοποιείτε. Τόποι για να ξεκινήσετε περιλαμβάνουν δωρεάν εργαλεία όπως cloudprice, Cloudping, και οι ιστορικές απόψεις περιστατικών από εργαλεία Cloud Service Health που παρέχονται από hyperscalers.
Επιλέξτε portable αντί για cloud-φυσικό.
Όταν αρχιτεκτονείτε ρυθμίσεις cloud, ο απλούστερος δρόμος είναι να πάτε cloud-φυσικό. Αλλά ενώ είναι βολικό να επιλέξετε εφαρμογές που έχουν κατασκευαστεί από και για τον πάροχο cloud σας, αυτές οι cloud-φυσικές επιλογές σας αφήνουν πιο εκτεθειμένες αν ο cloud σας πάει κάτω.
Για να αποφύγετε这一 επιπλέον στρώμα εξάρτησης cloud, επιλέξτε ανεξάρτητες και/ή ανοικτού κώδικα προϊόντα όπου είναι δυνατό. Κάποιες επιλογές αντικατάστασης περιλαμβάνουν τις ακόλουθες:
|
Κατηγορία |
Παράδειγμα Φυσικής Προσφοράς |
Ανοικτές Εναλλακτικές Επιλογές Περιλαμβάνουν… |
|
Αυθεντικοποίηση & Ταυτότητα |
AWS Cognito |
Keycloak |
|
Αναζήτηση |
Azure Monitor |
Elasticsearch |
|
Σχεσιακές Βάσεις Δεδομένων |
Google Cloud SQL |
PostgreSQL |
|
NoSQL Βάσεις Δεδομένων |
AWS DynamoDB |
MongoDB |
|
Διαχείριση Container |
Azure Kubernetes Service (AKS) |
Kubernetes |
|
Παρακολούθηση & Παρατηρήσιμότητα |
Google Cloud Monitoring |
Prometheus + Grafana |
|
Ουρές Μηνυμάτων |
AWS SQS/SNS |
Apache Kafka |
|
Αποθήκευση Αντικειμένων |
Azure Blob Storage |
MinIO |
|
Πύλη API |
Google Cloud API Gateway |
Kong |
Για να είμαστε σίγουροι, η κατασκευή περισσότερου του cloud stack σας από την αρχή σημαίνει περισσότερη δουλειά για τις ομάδες σας. Ωστόσο, με την εμπειρία μου, μια φορά που έχετε την υποδομή σε λειτουργία, δεν υπάρχει σχεδόν καμία διαφορά μεταξύ της προσθήκης φόρτου εργασίας σε μια καθιερωμένη υποδομή ή της λειτουργίας σε μια cloud-φυσική μια. Και τα οφέλη σε σχέση με την ανθεκτικότητα – όχι μόνο η μείωση της εξάρτησης cloud – κάνουν τις ανεξάρτητες επιλογές εξαιρετικά αξιο đáng.
Μηχανική για αποτυχία.
Δεδομένου ότι οι διακοπές cloud θα συμβούν, βεβαιωθείτε ότι σχεδιάζετε τα προϊόντα σας με διακοπές cloud στο μυαλό. Ένα παράδειγμα να κοιτάξετε είναι η Datadog: σε ένα περιστατικό του 2023, η εταιρεία έχασε ξαφνικά την πρόσβαση σε πάνω από το μισό των κόμβων Kubernetes σε παραγωγή και ξανασχεδίασε完全 την προσέγγισή της για καταστροφές. Οι αλλαγές περιελάμβαναν την αφαίρεση αρχιτεκτονικών σφαλμάτων και την αντιμετώπιση του τεχνικού χρέους ώστε να μην προκαλούνται μερικές αποτυχίες στο σύστημα, τη βελτίωση της εισαγωγής και της αποθήκευσης δεδομένων για μεγαλύτερη διαθεσιμότητα δεδομένων κατά τη διάρκεια διακοπών, και την κατασκευή συστημάτων για αυτόματη ανάκτηση σε κλίμακα. Ένας εξαιρετικός τόπος για να ξεκινήσετε στο ταξίδι σας είναι να ακολουθήσετε την σύσταση της Datadog να “ξεκινήσετε με αυτό που είναι σημαντικό για τον τελικό χρήστη” και να κατασκευάσετε ασφαλείς για να προστατεύσετε αυτό που έχει σημασία περισσότερο.
Τρέξτε τουλάχιστον σε δύο clouds.
Φυσικά, ο καλύτερος τρόπος για να μην είστε υπόχρεοι σε διακοπές cloud είναι η αναπαραγωγή multicloud. Η επίτευξη αληθινής ροής multicloud είναι ένα τεράστιο έργο για πολλές εταιρείες,既然 είναι εξαιρετικά δύσκολο να μεταφράσετε την υποδομή από ένα cloud σε ένα άλλο. Αλλά η κατασκευή υποδομής σε δύο clouds είναι ένα ισχυρό – και συχνά δυνατό – σημείο να ξεκινήσετε. Κρίσιμο για να κάνετε这一 να λειτουργήσει είναι να έχετε μια ομάδα με έναν ειδικό σε κάθε cloud που τρέχετε.
Για να είμαστε σίγουροι, τίποτα δεν μπορεί να προστατεύσει完全 τις εταιρείες από την επίδραση μιας μεγάλης διακοπής όπως αυτή που είδαμε αυτή την εβδομάδα. Αλλά με την σωστή προετοιμασία, μια προσεγγιστική προσέγγιση cloud, μηχανική για αποτυχία, και χρησιμοποιώντας “δual-cloud” ως βήμα για αληθινή multicloud, οι εταιρείες μπορούν να είναι πολύ πιο ευέλικτες όταν η επόμενη (και δυστυχώς αναπόφευκτη) μεγάλη διακοπή cloud συμβεί.












