AI-modeller och plattformar

DeepMind introducerar JEST-algoritmen: Gör AI-modellträning snabbare, billigare och mer miljövänlig

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Generativ AI gör otroliga framsteg och förvandlar områden som medicin, utbildning, finans, konst, sport etc. Denna utveckling beror främst på AI:s förbättrade förmåga att lära sig från större datamängder och bygga mer komplexa modeller med miljarder parametrar. Trots att dessa framsteg har drivit signifikanta vetenskapliga upptäckter, skapat nya affärsmöjligheter och lett till industriell tillväxt, kommer de till en hög kostnad, särskilt när det gäller de finansiella och miljömässiga konsekvenserna av att träna dessa storskaliga modeller. Läralgoritmerna kräver betydande beräkningskraft för att träna generativ AI-modeller med stora datamängder, vilket leder till hög energiförbrukning och en betydande koldioxidavtryck.

Medan tidigare insatser för att göra generativ AI hållbar har fokuserat på att förbättra hårdvarueffektiviteten för AI-träning och utveckla mindre modeller med färre parametrar, har Google DeepMind tagit en innovativ approach, med målet att förbättra effektiviteten i den generativa AI-träningsalgoritmen. De har banat väg för en ny algoritm, JEST (Joint Example Selection), som fungerar 13 gånger snabbare och är tio gånger mer energisnål än nuvarande tekniker.

I den här artikeln utforskar vi utmaningarna med AI-träning och hur JEST hanterar dessa problem. Dessutom undersöker vi de bredare implikationerna och framtida forskningsriktningar för JEST-algoritmen, med visionen om dess potentiella påverkan utöver att förbättra hastighet, kostnadseffektivitet och miljövänlighet i AI-träning.

Utmaningar med AI-träning: Hög kostnad och miljöpåverkan

Att träna generativa AI-modeller presenterar betydande utmaningar på grund av höga kostnader och betydande miljöpåverkan.

  • Finansiella kostnader: Att träna generativa AI-modeller är en kostsam process. Nya uppskattningar indikerar att träning av en enda stor modell, som OpenAI:s GPT-3 med 175 miljarder parametrar, kan kosta cirka 4,6 miljoner dollar. Att träna ChatGPT-4 beräknas ha kostat OpenAI cirka 100 miljoner dollar. Dessa utgifter är till stor del hänförbara till de enorma beräkningsresurserna, omfattande datahantering och långa tränings­tider som krävs.
  • Energiförbrukning: Processer för generativ AI-träning är extremt energikrävande. Att träna dessa modeller involverar tusentals GPU:er och förbrukar flera gigawattimmar energi, vilket gör processen extremt energikrävande. Datacenter, som inrymmer den beräkningsinfrastruktur som används för AI-träning, förbrukar cirka 200 terawattimmar (TWh) el per år, vilket motsvarar cirka 1% av den globala elkonsumtionen. En rapport från McKinsey förutspår att datacenterens elförbrukning i USA kan öka från 17 gigawatt (GW) 2017 till 35 GW år 2030, vilket kommer att kräva en elproduktion motsvarande nio Hoover-dammar för att möta denna ökade efterfrågan.
  • Koldioxidavtryck: Den höga energiförbrukningen vid träning av generativa AI-modeller bidrar betydligt till utsläpp av växthusgaser, vilket förvärrar klimatförändringarna. En studie från University of Massachusetts Amherst fann att träning av en stor AI-modell kan släppa ut lika mycket koldioxid som fem bilar under deras livstid. Specifikt kan träning av en enda AI-modell släppa ut mer än 626 000 pund koldioxid, vilket motsvarar koldioxidavtrycket från 315 transamerikanska flygningar.

Dessa utmaningar härrör främst från två huvudsakliga källor: beroendet av högenergiförbrukande beräkningsmaskiner och ineffektiviteten i nuvarande träningsalgoritmer. Medan AI-samhället har gjort framsteg i att utveckla energisnål hårdvara, måste det finnas ett större fokus på att skapa smartare algoritmer som kan optimera dataanvändning och minska tränings­tider. Googles nyligen introducerade JEST-algoritm är banbrytande forskning för att göra träningsalgoritmer smartare. Genom att intelligently välja den data som är viktigast förbättrar JEST avsevärt effektiviteten i AI-träning, vilket bana väg för mer hållbar och kostnadseffektiv träning av generativa AI-modeller.

Förstå JEST-algoritmen

JEST är en läralgoritm som är utformad för att träna multimodala generativa AI-modeller mer effektivt. För att förstå hur JEST fungerar, tänk på AI-träning som att lösa ett komplext pussel, där varje bit (data­punkt) hjälper till att bygga den kompletta bilden (AI-modell). JEST fungerar som en erfaren pussel­lösare, vilket gör processen mer effektiv. Precis som en pussel­lösare väljer ut de viktigaste och mest distinkta bitarna, identifierar och väljer JEST de mest värdefulla data­batcharna från datamängden, vilket säkerställer att varje batch spelar en avgörande roll i AI-utveckling.

JEST använder en mindre AI-modell för att utvärdera kvaliteten på data­batcharna. Dessa batchar rankas sedan baserat på deras effektivitet i modellträning. Med dessa noggrant utvalda batchar sätter JEST strategiskt samman dem för att träna modellen. Liksom en pussel­lösare arrangerar pusselbitar för att maximera effektivitet och sammanhang, förbättrar JEST avsevärt tränings­processen genom att prioritera och välja de mest informativa batcharna.

En viktig del av JEST:s tillvägagångssätt är multimodal kontrastiv inlärning. Denna teknik fokuserar på att lära sig korrespondensen mellan olika datatyper, som text och bilder. JEST använder en multimodal kontrastiv inlärningsbaserad metod för att utvärdera effektiviteten av en multimodal data­exempel i modellträning. Utöver effektiviteten hos enskilda data­exempel utvärderar JEST också den kollektiva lärandeförmågan hos data­exempel för att välja en liten batch av data från en större “superbatch”. Denna process hjälper JEST att välja och prioritera batchar som erbjuder utmaningar och rika lärandemöjligheter.

Blickar framåt: JEST bortom snabbare, billigare och grönare AI-träning

När vi utforskar de framtida implikationerna av JEST (Joint Example Selection) är det uppenbart att dess bidrag sträcker sig bortom att bara påskynda AI-träning, minska kostnader och främja miljö­hållbarhet. Här undersöker vi hur JEST kan fortsätta att förbättra och omvandla området generativ AI:

  • Förbättrad modellprestanda och noggrannhet: JEST:s innovativa tillvägagångssätt för data­val och prioritering leder till snabbare tränings­tider och förbättrad modellprestanda. Genom att fokusera på de mest informativa data­batcharna säkerställer JEST att AI-modellerna tränas på högkvalitativa indata, vilket förbättrar deras noggrannhet och robusthet. Denna fördel är avgörande i tillämpningar där precision och tillförlitlighet är av största vikt, som medicinsk diagnostik, finansiell prognostisering och autonoma system.
  • Identifiering och mildring av bias i data: AI är benägen för fördomsfulla datamängder där vissa grupper eller perspektiv är underrepresenterade eller felrepresenterade. JEST:s data­valtillvägagångssätt innefattar utvärdering av data­batcharnas kvalitet och informativitet. Genom att prioritera diversa och representativa data­exempel kan JEST hjälpa AI-system att lära sig från en mer balanserad datamängd, vilket minskar fördomar i träningsdata. Till exempel i AI-tillämpningar inom hälso- och sjukvård kan JEST välja data­batchar som omfattar olika demografiska faktorer, vilket säkerställer att medicinska diagnostiska modeller tränas på diversa patientpopulationer. Detta val minskar risken för fördomar som kan påverka vissa grupper oproportionerligt baserat på ras, kön eller socioekonomisk status.
  • Underlättande av innovation och forskning: Genom att betydligt minska de beräkningsresurser och tid som krävs för AI-modellträning, minskar JEST inträdesbarriärerna för forskare och innovatörer. Denna tillgänglighet främjar en mer vibrerande ekosystem för AI-utveckling, där mindre team och organisationer kan experimentera med och distribuera avancerade AI-lösningar. Dessutom frigör effektivitetsvinningarna som erbjuds av JEST resurser som kan omallokeras till att utforska nya områden inom AI, som nya arkitekturer, avancerade algoritmer och etiska AI-ramverk.
  • Främjande av inkluderande AI-utveckling: AI-utveckling bör involvera diversa perspektiv och indata för att effektivt mildra fördomar och etiska problem. JEST:s förmåga att välja data baserat på dess informativa värde och representativitet uppmuntrar inkluderande metoder för datamängdshantering. AI-utvecklare kan säkerställa att JEST effektivt hanterar fördomar och etiska överväganden genom att involvera multidisciplinära team i att definiera data­valskriterier, inklusive experter inom etik, samhällsvetenskap och ämnesspecifika områden. Detta samarbetsinriktade tillvägagångssätt främjar en mer inkluderande och ansvarsfull utveckling av AI-teknologier.

Sammanfattning

DeepMinds introduktion av JEST-algoritmen representerar ett betydande steg framåt i generativ AI-träning. Genom att avsevärt påskynda träningsprocesser och minska energiförbrukning erbjuder JEST betydande kostnadsbesparingar och hanterar miljörelaterade problem som är kopplade till AI-utveckling. Utöver dessa fördelar har JEST potentialen att förbättra modellnoggrannhet, mildra datafördomar, främja innovation och uppmuntra inkluderande AI-utveckling. Den pågående förfiningen och tillämpningen av JEST är redo att omdefiniera framtiden för AI, med fokus på mer effektiv, hållbar och etiskt ansvarsfull AI-lösningar.

Dr. Tehseen Zia är en fast anställd biträdande professor vid COMSATS University Islamabad, med en doktorsexamen i AI från Vienna University of Technology, Österrike. Specialiserad på artificiell intelligens, maskinlärning, datavetenskap och datorseende, har han gjort betydande bidrag med publikationer i ansedda vetenskapliga tidskrifter. Dr. Tehseen har också lett olika industriprojekt som huvudutredare och tjänstgjort som AI-konsult.