Modele i platformy AI

DeepMind wprowadza algorytm JEST: przyspieszając szkolenie modeli AI, taniej, bardziej ekologicznie

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Sztuczna inteligencja generatywna robi niesamowite postępy, przekształcając obszary takie jak medycyna, edukacja, finanse, sztuka, sport itd. Postęp ten wynika głównie z poprawy zdolności sztucznej inteligencji do uczenia się z większych zbiorów danych i tworzenia bardziej złożonych modeli z miliardami parametrów. Chociaż te postępy przyniosły znaczące odkrycia naukowe, stworzyły nowe możliwości biznesowe i przyczyniły się do wzrostu gospodarczego, mają one wysoką cenę, zwłaszcza jeśli weźmie się pod uwagę finansowe i środowiskowe koszty szkolenia tych dużych modeli. Algorytmy uczenia się wymagają znacznej mocy obliczeniowej, aby szkolić modele sztucznej inteligencji generatywnej z dużymi zbiorami danych, co prowadzi do wysokiego zużycia energii i znaczącego śladu węglowego.

Podczas gdy poprzednie próby uczynienia sztucznej inteligencji generatywnej zrównoważoną skupiały się na poprawie wydajności sprzętu do szkolenia AI i tworzeniu mniejszych modeli z mniejszą liczbą parametrów, Google DeepMind podjął innowacyjne podejście, aby poprawić wydajność algorytmu szkolenia sztucznej inteligencji generatywnej. Opracowali nowy algorytm, JEST (Joint Example Selection), który działa 13 razy szybciej i jest 10 razy bardziej wydajny energetycznie niż obecne techniki.

W tym artykule eksplorujemy wyzwania szkolenia AI i jak JEST rozwiązuje te problemy. Dodatkowo rozważamy szersze implikacje i przyszłe kierunki badań algorytmu JEST, wyobrażając sobie jego potencjalny wpływ na poprawę wydajności modeli, redukcję biasów, promowanie innowacji i rozwój inkluzywny sztucznej inteligencji.

Wyzwania szkolenia AI: wysokie koszty i wpływ na środowisko

Szkolenie modeli sztucznej inteligencji generatywnej stanowi znaczące wyzwania ze względu na wysokie koszty i znaczący wpływ na środowisko.

  • Koszty finansowe: Szkolenie modeli sztucznej inteligencji generatywnej jest kosztownym przedsięwzięciem. Ostatnie szacunki wskazują, że szkolenie jednego dużego modelu, takiego jak OpenAI’s GPT-3 z 175 miliardami parametrów, może kosztować około 4,6 miliona dolarów. Szkolenie ChatGPT-4 szacowane jest na około 100 milionów dolarów. Te wydatki są w dużej mierze przypisywane do ogromnych zasobów obliczeniowych, rozległej obróbki danych i długich czasów szkolenia.
  • Zużycie energii: Procesy szkolenia sztucznej inteligencji generatywnej są niezwykle energochłonne. Szkolenie tych modeli wymaga tysięcy procesorów graficznych i zużywa wiele gigawatogodzin energii, co czyni ten proces niezwykle energochłonnym. Centra danych, które mieszczą infrastrukturę obliczeniową dla szkolenia AI, zużywają około 200 terawatogodzin (TWh) energii elektrycznej rocznie, co stanowi około 1% globalnego zapotrzebowania na energię elektryczną. Raport McKinseya przewiduje, że zużycie energii przez centra danych w Stanach Zjednoczonych może wzrosnąć z 17 gigawatów (GW) w 2017 roku do 35 GW do 2030 roku, co wymagałoby dodatkowej mocy równoważnej dziewięciu tamom Hoovera, aby zaspokoić to dodatkowe zapotrzebowanie.
  • Ślad węglowy: Wysokie zużycie energii przez szkolenie modeli sztucznej inteligencji generatywnej znacząco przyczynia się do emisji gazów cieplarnianych, nasilając zmiany klimatyczne. Badanie przeprowadzone przez Uniwersytet w Massachusetts Amherst wykazało, że szkolenie dużego modelu AI może emitować tyle samo dwutlenku węgla, co pięć samochodów przez cały ich okres eksploatacji. Konkretnie, szkolenie jednego modelu AI może emitować ponad 626 000 funtów CO2, co jest równoważne śladowi węglowemu 315 lotów transamerykańskich.

Te wyzwania pochodzą głównie z dwóch głównych źródeł: zależności od sprzętu o wysokim zużyciu energii i niewydajności algorytmów szkolenia. Chociaż społeczność AI dokonała postępów w tworzeniu wydajnego sprzętu, powinno być więcej nacisku na tworzenie inteligentniejszych algorytmów, które mogą optymalizować użycie danych i skracać czasy szkolenia. Niedawno wprowadzony algorytm JEST przez Google jest pionierskim badaniem w kierunku uczynienia algorytmów szkolenia bardziej inteligentnymi. Poprzez inteligentny wybór danych, które mają znaczenie, JEST znacząco zwiększa wydajność szkolenia AI, tworząc drogę do bardziej zrównoważonego i ekonomicznego szkolenia modeli sztucznej inteligencji generatywnej.

Zrozumienie algorytmu JEST

JEST to algorytm uczenia się zaprojektowany do bardziej wydajnego szkolenia modeli sztucznej inteligencji generatywnej. Aby zrozumieć, jak działa JEST, wyobraź sobie szkolenie AI jako rozwiązywanie skomplikowanej układanki, gdzie każdy element (punkt danych) pomaga zbudować pełny obraz (model AI). JEST działa jak doświadczony rozwiązywacz układanek, czyniąc proces bardziej wydajnym. Podobnie jak rozwiązywacz układanek wybiera najważniejsze i najbardziej charakterystyczne elementy, JEST identyfikuje i wybiera najcenniejsze partie danych z zestawu danych, zapewniając, że każda partia odgrywa kluczową rolę w rozwoju AI.

JEST wykorzystuje mniejszy model AI do oceny jakości partii danych. Partie te są następnie klasyfikowane według ich skuteczności w szkoleniu modelu. Z tymi starannie wybranymi partiami JEST strategicznie łączy je, aby szkolić model. Podobnie jak rozwiązywacz układanek układa elementy układanki, aby maksymalizować wydajność i spójność, JEST znacząco przyspiesza proces szkolenia, priorytetyzując i wybierając najbardziej informacyjne partie.

Kluczową częścią podejścia JEST jest multimodalne uczenie kontrastowe. Ta technika koncentruje się na uczeniu korelacji między różnymi typami danych, takimi jak tekst i obrazy. JEST wykorzystuje metodę opartą na multimodalnym uczeniu kontrastowym, aby ocenić skuteczność próbki danych multimodalnych w szkoleniu modelu. Oprócz skuteczności indywidualnych próbek danych JEST również ocenia kolektywną możliwość uczenia się próbek danych, aby wybrać małą partię danych z większej “super partii”. Ten proces pomaga JEST wybrać i priorytetyzować partie, które oferują wyzwania i bogate możliwości uczenia się.

Spójrzmy w przyszłość: JEST poza szybszym, tańszym, bardziej ekologicznym szkoleniem AI

Gdy eksplorujemy przyszłe implikacje JEST (Joint Example Selection), jest oczywiste, że jego wkład wykracza poza zwykłe przyspieszanie szkolenia AI, obniżanie kosztów i promowanie zrównoważoności środowiskowej. Tutaj zagłębiamy się w to, jak JEST może dalej poprawiać i transformować dziedzinę sztucznej inteligencji generatywnej:

  • Poprawiona wydajność modelu i dokładność: Innowacyjne podejście JEST do wyboru i priorytetyzacji danych prowadzi do szybszych czasów szkolenia i poprawionej wydajności modelu. Poprzez koncentrowanie się na najbardziej informacyjnych partiach danych JEST zapewnia, że modele AI są szkolone na wysokiej jakości danych wejściowych, poprawiając ich dokładność i wytrzymałość. Ta zaleta jest kluczowa w aplikacjach, gdzie precyzja i niezawodność są niezbędne, takich jak diagnostyka medyczna, prognozowanie finansowe i systemy autonomiczne.
  • Identyfikacja i łagodzenie biasów w danych: Sztuczna inteligencja jest podatna na zbiory danych, w których pewne grupy lub perspektywy są niedoreprezentowane lub niewłaściwie reprezentowane. Podejście JEST do wyboru danych obejmuje ocenę jakości i informacyjności partii danych. Poprzez priorytetyzowanie różnorodnych i reprezentatywnych próbek danych JEST może pomóc systemom AI w nauce na bardziej zrównoważonym zestawie danych, tym samym redukuje biasy w danych szkoleniowych. Na przykład w aplikacjach sztucznej inteligencji w ochronie zdrowia JEST może wybrać partie danych, które obejmują różne czynniki demograficzne, zapewniając, że modele diagnostyki medycznej są szkolone na różnorodnych populacjach pacjentów. Ten wybór redukuje ryzyko biasów, które mogą nieproporcjonalnie wpłynąć na pewne grupy ze względu na rasę, płeć lub status społeczno-ekonomiczny.
  • Ułatwianie innowacji i badań: Poprzez znaczące obniżenie wymagań obliczeniowych i czasu potrzebnego do szkolenia modeli AI, JEST obniża bariery wejścia dla badaczy i innowatorów. To dostępność sprzyja bardziej żywiołowej ekosystemowi rozwoju AI, gdzie mniejsze zespoły i organizacje mogą eksperymentować z zaawansowanymi rozwiązaniami AI. Ponadto korzyści wydajnościowe oferowane przez JEST uwalniają zasoby, które mogą być przekierowane na eksplorowanie nowych obszarów w AI, takich jak nowe architektury, zaawansowane algorytmy i ramy etyczne AI.
  • Promowanie inkluzywnego rozwoju AI: Rozwój AI powinien angażować różnorodne perspektywy i dane, aby skutecznie łagodzić biasy i problemy etyczne. Możliwość JEST do wyboru danych na podstawie ich wartości informacyjnej i reprezentatywności zachęca do praktyk inkluzywnych w kuracji zbiorów danych. Deweloperzy AI mogą zapewnić, że JEST skutecznie rozwiązuje biasy i problemy etyczne, angażując zespoły multidyscyplinarne w definiowanie kryteriów wyboru danych, w tym ekspertów z dziedziny etyki, nauk społecznych i dziedziny specjalnej. To współpracujące podejście sprzyja bardziej inkluzywnemu i odpowiedzialnemu rozwojowi technologii AI.

Podsumowanie

Wprowadzenie algorytmu JEST przez DeepMind stanowi znaczący krok naprzód w szkoleniu sztucznej inteligencji generatywnej. Poprzez znaczące przyspieszanie procesów szkolenia i redukowanie zużycia energii, JEST oferuje znaczące oszczędności kosztów i rozwiązuje problemy środowiskowe związane z rozwojem AI. Poza tymi korzyściami JEST ma potencjał poprawy dokładności modeli, łagodzenia biasów w danych, promowania innowacji i inkluzywnego rozwoju AI. Kontynuacja doskonalenia i stosowania JEST ma szansę zdefiniować przyszłość AI, zmierzając ku bardziej wydajnym, zrównoważonym i etycznie odpowiedzialnym rozwiązaniom AI.

Dr. Tehseen Zia jest profesorem nadzwyczajnym w COMSATS University Islamabad, posiada tytuł doktora w dziedzinie sztucznej inteligencji na Vienna University of Technology, Austria. Specjalizując się w sztucznej inteligencji, uczeniu maszynowym, nauce o danych i widzeniu komputerowym, wniósł znaczący wkład poprzez publikacje w renomowanych czasopismach naukowych. Dr. Tehseen Zia również kierował różnymi projektami przemysłowymi jako główny badacz i pełnił funkcję konsultanta ds. sztucznej inteligencji.