Liderzy opinii

Podręcznik wytrzymałości chmury Super Bowl

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Wśród całego zainteresowania Super Bowl można łatwo zapomnieć o infrastrukturze działającej za kulisami. Aby Super Bowl mógł się odbyć bez zakłóceń – nie tylko sama transmisja, ale także ogromna sieć firm działających wokół wydarzenia – muszą działać tysiące systemów backendowych na maksymalnej wydajności.

Jest kilka obszarów, w których jest to szczególnie prawdziwe, a jednym z nich jest chmura. Niezależnie od tego, czy jest to AWS wspierający transmisję Peacock lub operacje Seattle Seahawks – lub, aby wymienić inny przykład, Google Cloud wspierający Igrzyska Olimpijskie 2028 lub Microsoft Azure napędzający Premier League – chmura jest krytyczna dla każdego dużego wydarzenia sportowego.

Dlatego, jeśli Twoja firma uczestniczy w jakiejkolwiek aktywności Super Bowl w 2026 roku, prawdopodobnie przemyślałeś już plan chmury na dzień meczu (a jeśli nie, to już za późno). Ale jeśli rozważasz udział w Super Bowl 2027 – lub po prostu chcesz poprawić swoją grę w chmurze – ten artykuł jest dla Ciebie.

Poniżej przedstawię Podręcznik chmury, który musisz wykonać, aby utrzymać swoją drużynę zwinność i gotowość do gry. W interesie miejsca, skupię się specjalnie na dwóch krytycznych obszarach, w których stresory chmury pojawiają się w dniu meczu: niezwykłym napływie danych i silnej zależności od AI.

Ale najpierw, zróbmy szybki podsumowanie, aby ocenić zagrożenie awarią chmury.

Podstawy pierwszej kwarty: Jak bardzo należy polegać na chmurze?

Przed rozpoczęciem chcę być jasny: jest więcej niż wystarczających powodów, aby ligi, drużyny i duże aplikacje ufundowały swoim klientom i operacjom na największych dostawcach chmury. Najwięksi dostawcy chmury zdobyli swoją reputację za niezawodność – i dowody wskazują, że ich niezawodność tylko wzrosła.

Ale jednocześnie jest jasne, że każda podstawowa infrastruktura może zawieść – nawet w krytycznych momentach, kiedy można założyć, że dostawcy infrastruktury pracują nadtime, aby zapewnić idealne działanie. Pamiętajmy (niezwiązaną z chmurą) awarię Coinbase z 2022 roku lub przerwę w zasilaniu Superdome w 2013 roku? Lub, bliżej strony chmury, przypomnijmy, że ostatnia awaria platformy Azure miała miejsce zaledwie kilka godzin przed planowanym wydaniem kwartalnych wyników w zeszłym październiku.

Innymi słowy: Zakładaj, że Twój dostawca chmury poradzi sobie bez problemu w ten niedzielny dzień – ale zawsze przygotuj się na najgorsze. A mając to na uwadze, spójrzmy na dwa główne problemy, które powodują większość wyzwań chmury.

Napór danych: Radzenie sobie z bezprecedensowym napływem

Chmury wspierają operacje Super Bowl, w których wymagania dotyczące danych są większe niż kiedykolwiek wcześniej. Za przykład można podać, że w zeszłym roku FOX poinformował, że aby wesprzeć transmisję na żywo, Super Bowl 2025 dostarczył treści do 15,5 miliona użytkowników jednocześnie i wymagał około 135 Tbps – w porównaniu z 3,4 miliona użytkowników jednocześnie i 15 Tbps w 2020 roku.

Oczywiście, co jest ważne, to to, że skok w użyciu danych nastąpił, ponieważ objętość danych wybuchła – zarówno pod względem objętości, jak i rodzajów danych wprowadzanych do obrazu. Ten trend zwiększa złożoność zarządzania danymi – i, jak donosi Uptime Institute, ta złożoność stanowi nowe zagrożenie dla awarii.

Jednym ze źródeł tej nowej złożoności jest oczywiście AI.

Drugie kwarty: Rewolucja AI

W ciągu ostatnich kilku lat ten stres danych jest w dużej mierze generowany (i zarządzany) przez nowy element: rozwój AI. Chociaż Super Bowl-specyficzne AI nie jest łatwo dostępne, szybki przegląd ekosystemu NFL pokazuje wiele aplikacji AI, które dotykają niemal każdy aspekt gry. Za przykład można podać, jak AI jest używana w futbolu:

  • Gra – System Sideline Viewing System NFL, tablety smartboard opracowane przez Microsoft, zostały ulepszone o dostęp do GitHub Copilot, aby “filtrować dane na podstawie kryteriów, takich jak podanie i odległość, punktacja, karne, aby szybko analizować formacje, odczytywać osłony i podejmować bardziej oparte na danych i strategiczne decyzje” według ogłoszenia NFL.

  • Transmisja – ESPN wprowadził dane na żywo i prawdopodobieństwa gry, możliwe dzięki Next Gen Stats i aplikacji analitycznej i predykcyjnej TruPlay AI Adrenaline.

  • Ligi fantasy – NFL uruchomił wskazówki AI dla lig fantasy w nowym Asystent fantasy AI NFL Pro (stworzony we współpracy z AWS AI, Next Gen Stats i NFL Fantasy).

  • Zakłady – Aplikacja zakładów FanDuel wprowadziła funkcję czatu AI do wspomagania zakładów na NFL i NBA w zeszłym marcu.

Plus, istnieją liczne sposoby, w jakie AI napędza grę, zanim dojdzie do dnia meczu – od partnerstw NFL z AWS AI wokół kwestii bezpieczeństwa i planowania meczów, do użycia Microsoft Azure AI Foundry do wspomagania bardziej inteligentnych wyborów draftowych. Nie jest zaskoczeniem, że giganci AI zawierają umowy z NFL – w tym Cisco, które posiada partnerstwa infrastrukturalne AI z wieloma franczyzami NFL, w tym z New England Patriots.

W samym dniu meczu nowe AI dodaje do nowej złożoności i objętości danych, o których wspomniałem wcześniej. Długoterminowo, stanowi to kolejne źródło niestabilności chmury – co wyjaśnię w dalszej części.

Ślepa strona: Ukryte zagrożenie AI dla niezawodności chmury

Oprócz wymogu bardzo specyficznego zarządzania danymi, AI jest również potencjalnym źródłem następnej fali słabości chmury. W następstwie dwóch dużych awarii AWS i Azure w zeszłym roku, Lee Suster z Forrester Research ostrzega, że awarie “nie były izolowane – są zapowiedzią tego, co ma nadejść” – i że AI jest kluczowym czynnikiem przyspieszającym niebezpieczeństwa. Jak pisze Suster:

Hyperscalers odwracają inwestycje od starszych środowisk x86 i ARM, priorytetowo traktując centra danych zorientowane na GPU dla obciążeń AI, podczas gdy starsza infrastruktura zawodzi pod wpływem rosnącej złożoności. Uważamy, że ta strategia będzie miała znaczące konsekwencje w postaci co najmniej dwóch dużych, wielodniowych awarii w 2026 roku.

AI staje się coraz bardziej istotne – i tworzy warunki biznesowe, które sprawiają, że chmury są mniej godne zaufania niż wcześniej. To kolejny powód, dla którego AI zmusza graczy IT do obrony. Poniżej znajdują się kluczowe strategie.

Wygrana obrona: Podstawowe zagrywki ochrony chmury

Aby zabezpieczyć operacje chmury i utrzymać ciągłość biznesu, upewnij się, że:

  • Wdrożysz wykrywanie anomalii napędzane przez AI i ciągłe testowanie wytrzymałości. Użyj uczenia maszynowego, aby wykryć problemy, zanim wpłyną na użytkowników. Regularnie symuluj awarie – regionalne przerwy, degradacje usług – w środowiskach podobnych do produkcyjnych, aby zwalidować, czy Twoje systemy odzyskiwania naprawdę działają.

  • Wyeliminuj pojedyncze punkty awarii za pomocą aktywnych wdrożeń wielochmurowych. Uruchom produkcję na wielu dostawcach i regionach jednocześnie, każdy obsługujący ruch na żywo. Użyj przesunięcia ruchu w czasie rzeczywistym i geo-nadmiarowości, aby kierować użytkownikami na podstawie bieżących warunków, umożliwiając odzyskiwanie awarii znacznie szybciej, niezależnie od miejsca, w którym wystąpią awarie.

Kluczowe dla tego drugiego punktu jest budowanie systemów, które nie są związane z jednym dostawcą. Nie tylko pracuj w wielu chmurach – pracuj nad prawdziwą redundancją i płynnością chmury. Poniżej znajdują się trzy kroki, które należy rozważyć, aby osiągnąć tę zwinność:

  • Trzymaj się narzędzi, które działają w chmurach. Na przykład, używaj Kubernetes zamiast usług kontenerowych rodzimych dla dostawcy, Okta lub Keycloak zamiast AWS Cognito do uwierzytelniania, Terraform zamiast opcji specyficznych dla dostawcy, takich jak AWS CloudFormation, jeśli chodzi o infrastrukturę jako kod.

  • Zachowaj ścisłą kontrolę nad konfiguracją. Kontroluj wersję wszystkiego, aby wiedzieć dokładnie, co jest uruchomione, i możesz szybko cofnąć, gdy coś pójdzie nie tak. Zdefiniuj infrastrukturę za pomocą kodu, a nie klikając wokół w konsoli. Zablokuj dostęp administracyjny, aby nikt nie mógł wprowadzać zmian, które nie zostaną udokumentowane.

  • Ustaw środowisko awaryjne, zanim będziesz je potrzebować. Nie możesz pozwolić sobie na to, aby poczekać, aż awaria wystąpi, zanim zaczniesz uruchamiać drugiego dostawcę chmury. Zbuduj równoległe środowiska teraz i naprawdę przetestuj swoją automatyzację awaryjną regularnie – nie pozwól, aby stała się jednym z tych runbooków, które pozostają niewidoczne przez pół roku. Innymi słowy: Zrób wszystkie swoje ćwiczenia teraz, aby być gotowym do wejścia na boisko w dniu meczu.

Ostateczny gwizdek: Budowanie mistrzowskiej infrastruktury

Super Bowl testuje nie tylko zawodników na boisku – testuje także każdy system wspierający grę, w tym chmurę. Dla specjalistów IT lekcje są proste: niezawodna infrastruktura chmury wymaga takiego samego przygotowania i strategicznego myślenia, jakie jest wymagane do planowania dnia meczu. Upewnij się, że jesteś przygotowany, aby przetrwać awarie, uniknąć blokady i móc poruszać się zwinnością między chmurami w kryzysie. Zrób to, a będziesz na drodze do mistrzowskiej strategii chmury.

Harshit Omar jest współzałożycielem i CTO firmy FluidCloud, gdzie buduje przyszłość infrastruktury chmurowej, umożliwiając firmom bezproblemową migrację, replikację i optymalizację obciążeń w środowiskach wielochmurowych. Był wcześniej pierwszym inżynierem w Accurics, gdzie kierował podstawowymi wysiłkami rozwojowymi dotyczącymi silnika polityki i platformy bezpieczeństwa chmury.

Z głęboką ekspertyzą w zakresie Go, Kubernetes, Terraform i zgodności chmury, Harshit spędził ponad dekadę projektując odporne systemy w środowiskach AWS, Azure i GCP.

Jego misją jest teraz wyeliminowanie blokady chmury i uczynienie infrastruktury tak przenośną i odporną jak kod.