AI-modeller och plattformar
ChatGPT:s första årsdag: Omformning av framtiden för AI-interaktion
När vi ser tillbaka på ChatGPT:s första år är det tydligt att detta verktyg har förändrat AI-scenen avsevärt. Lanserat i slutet av 2022 stack ChatGPT ut på grund av sin användarvänliga och konversationsstil som gjorde interaktion med AI mer som att prata med en person än en maskin. Denna nya tillvägagångssätt fångade snabbt allmänhetens öga. Inom bara fem dagar efter dess utgivning hade ChatGPT redan lockat till sig en miljon användare. I början av 2023 hade detta antal svällt till cirka 100 miljoner månatliga användare, och i oktober drog plattformen in runt 1,7 miljarder besök världen över. Dessa siffror talar om för dess popularitet och användbarhet.
Under det senaste året har användare hittat alla möjliga kreativa sätt att använda ChatGPT, från enkla uppgifter som att skriva e-post och uppdatera CV till att starta framgångsrika företag. Men det handlar inte bara om hur människor använder det; teknologin i sig har växt och förbättrats. Initialt var ChatGPT en kostnadsfri tjänst som erbjöd detaljerade textsvar. Nu finns det ChatGPT Plus, som inkluderar ChatGPT-4. Denna uppdaterade version är tränad på mer data, ger färre felaktiga svar och förstår komplexa instruktioner bättre.
En av de största uppdateringarna är att ChatGPT nu kan interagera på flera sätt – den kan lyssna, tala och till och med bearbeta bilder. Detta innebär att du kan prata med den genom dess mobilapp och visa den bilder för att få svar. Dessa förändringar har öppnat upp nya möjligheter för AI och har förändrat hur människor ser och tänker om AI:s roll i våra liv.
Från dess början som en teknisk demo till dess nuvarande status som en stor spelare i tech-världen är ChatGPT:s resa ganska imponerande. Initialt sågs det som ett sätt att testa och förbättra tekniken genom att få feedback från allmänheten. Men det blev snabbt en essentiell del av AI-landskapet. Denna framgång visar hur effektivt det är att finjustera stora språkmodeller (LLM) med både övervakad inlärning och feedback från människor. Som ett resultat kan ChatGPT hantera en mängd olika frågor och uppgifter.
Jakten på att utveckla de mest kapabla och mångsidiga AI-systemen har lett till en spridning av både öppen källkod och proprietära modeller som ChatGPT. För att förstå deras allmänna förmågor krävs omfattande benchmarking över ett brett spektrum av uppgifter. Denna sektion utforskar dessa benchmarking, och belyser hur olika modeller, inklusive ChatGPT, står sig i jämförelse med varandra.
Utvardering av LLM: Benchmarking
- MT-Bench: Denna benchmark testar multi-turn konversation och instruktionsföljande förmågor över åtta domäner: skrivning, rollspel, informationsutvinning, resonemang, matematik, kodning, STEM-kunskap och humaniora/samhällsvetenskap. Starkare LLM som GPT-4 används som utvärderare.
- AlpacaEval: Baserat på AlpacaFarm-utvärderingsuppsättningen, denna LLM-baserade automatiska utvärderare benchmarkar modeller mot svar från avancerade LLM som GPT-4 och Claude, och beräknar vinstfrekvensen för kandidatmodeller.
- Öppen LLM-ledare: Med hjälp av Language Model Evaluation Harness utvärderar denna ledare LLM på sju nyckelbenchmark, inklusive resonemangsutmaningar och allmänna kunskapstester, i både nollskott och fåskottsscenarier.
- BIG-bench: Denna samarbetsbenchmark täcker över 200 nya språkuppgifter, som spänner över en mångfald av ämnen och språk. Den syftar till att testa LLM och förutsäga deras framtida förmågor.
- ChatEval: En multi-agent debatt ram som tillåter team att autonomt diskutera och utvärdera kvaliteten på svar från olika modeller på öppna frågor och traditionella naturliga språkgenereringsuppgifter.
Jämförande prestation
Vad gäller allmänna benchmark har öppen källkods-LLM visat anmärkningsvärd framgång. Llama-2-70B, till exempel, uppnådde imponerande resultat, särskilt efter att ha finjusterats med instruktionsdata. Dess variant, Llama-2-chat-70B, utmärkte sig i AlpacaEval med en vinstfrekvens på 92,66 %, och överträffade GPT-3.5-turbo. Men GPT-4 förblir fortfarande ledaren med en vinstfrekvens på 95,28 %.
Zephyr-7B, en mindre modell, visade förmågor jämförbara med större 70B LLM, särskilt i AlpacaEval och MT-Bench. Medan WizardLM-70B, finjusterad med en mångfald av instruktionsdata, uppnådde den högsta poängen bland öppen källkods-LLM på MT-Bench. Men den låg fortfarande efter GPT-3.5-turbo och GPT-4.
En intressant nyhet, GodziLLa2-70B, uppnådde en konkurrenskraftig poäng på den öppna LLM-ledaren, och visade potentialen för experimentella modeller som kombinerar mångfaldiga dataset. På liknande sätt utmärkte sig Yi-34B, utvecklad från scratch, med poäng jämförbara med GPT-3.5-turbo och bara något sämre än GPT-4.
UltraLlama, med sin finjustering på mångfaldig och högkvalitativ data, matchade GPT-3.5-turbo i dess föreslagna benchmark och till och med överträffade den i områden som världen och professionell kunskap.
Skalning upp: Stora LLM:s uppgång
En anmärkningsvärd trend i LLM-utveckling har varit skalningen av modellparametrar. Modeller som Gopher, GLaM, LaMDA, MT-NLG och PaLM har pressat gränserna, och kulminerat i modeller med upp till 540 miljarder parametrar. Dessa modeller har visat exceptionella förmågor, men deras slutna källkods-natur har begränsat deras bredare tillämpning. Denna begränsning har väckt intresse för att utveckla öppen källkods-LLM, en trend som växer i styrka.
I parallell med att skala upp modellstorlekar har forskare utforskat alternativa strategier. Istället för att bara göra modellerna större, har de fokuserat på att förbättra förträning av mindre modeller. Exempel inkluderar Chinchilla och UL2, som har visat att mer inte alltid är bättre; smartare strategier kan ge effektiva resultat också. Dessutom har det funnits betydande uppmärksamhet på instruktionsjustering av språkmodeller, med projekt som FLAN, T0 och Flan-T5 som har gjort betydande bidrag till detta område.
ChatGPT-katalysatorn
Introduktionen av OpenAI:s ChatGPT markerade en vändpunkt i NLP-forskning. För att konkurrera med OpenAI lanserade företag som Google (GOOGL ) och Anthropic sina egna modeller, Bard och Claude, respectively. Medan dessa modeller visar jämförbara prestationer med ChatGPT i många uppgifter, ligger de fortfarande efter den senaste modellen från OpenAI, GPT-4. Framgången för dessa modeller tillskrivs primärt förstärkt inlärning från mänsklig feedback (RLHF), en teknik som får ökad forskningsfokus för ytterligare förbättring.
Ryktesspridning och spekulation kring OpenAI:s Q* (Q-Stjärna)
Nya rapporter antyder att forskare på OpenAI kan ha uppnått en betydande framsteg i AI med utvecklingen av en ny modell kallad Q* (uttalas Q-stjärna). Påståendet är att Q* har förmågan att utföra grundskolenivås matematik, en prestation som har väckt diskussioner bland experter om dess potential som en milstolpe mot artificiell allmän intelligens (AGI). Medan OpenAI inte har kommenterat dessa rapporter, har de påstådda förmågorna hos Q* genererat betydande upphetsning och spekulation på sociala medier och bland AI-entusiaster.
Utvecklingen av Q* är anmärkningsvärd eftersom befintliga språkmodeller som ChatGPT och GPT-4, medan de kan utföra vissa matematiska uppgifter, är inte särskilt bra på att hantera dem tillförlitligt. Utmaningen ligger i behovet av att AI-modeller inte bara kan känna igen mönster, som de för närvarande gör genom djupinlärning och transformer, utan också resonera och förstå abstrakta koncept. Matematik, som en benchmark för resonemang, kräver att AI-planen och utför flera steg, och visar en djup förståelse av abstrakta koncept. Denna förmåga skulle markera en betydande språng i AI-förmågor, potentiellt utöver matematik till andra komplexa uppgifter.
Men experter varnar mot att överdriva denna utveckling. Medan ett AI-system som tillförlitligt löser matematiska problem skulle vara en imponerande prestation, signalerar det inte nödvändigtvis början på superintelligent AI eller AGI. Nuvarande AI-forskning, inklusive ansträngningar av OpenAI, har fokuserat på elementära problem, med varierande grad av framgång i mer komplexa uppgifter.
De potentiella tillämpningarna av framsteg som Q* är omfattande, från personlig undervisning till att assistera i vetenskaplig forskning och ingenjörskonst. Men det är också viktigt att hantera förväntningar och erkänna begränsningarna och säkerhetsproblem som är förknippade med sådana framsteg. Bekymren om AI som utgör existerande risker, en grundläggande oro för OpenAI, förblir relevanta, särskilt när AI-system börjar interagera mer med den verkliga världen.
Öppen källkods-LLM-rörelsen
För att främja öppen källkods-LLM-forskning släppte Meta Llama-seriens modeller, vilket utlöste en våg av nya utvecklingar baserade på Llama. Detta inkluderar modeller finjusterade med instruktionsdata, som Alpaca, Vicuna, Lima och WizardLM. Forskning grenar sig också till att förbättra agentförmågor, logiskt resonemang och långkontextmodellering inom Llama-ramen.
Dessutom finns en växande trend att utveckla kraftfulla LLM från scratch, med projekt som MPT, Falcon, XGen, Phi, Baichuan, Mistral, Grok och Yi. Dessa ansträngningar speglar ett engagemang för att demokratisera de avancerade AI-verktygens förmågor, och göra dem mer tillgängliga och effektiva.
ChatGPT:s och öppen källkodsmodellernas påverkan inom hälsovården
Vi ser en framtid där LLM assisterar i kliniska anteckningar, formfyllning för ersättning och stödjer läkare i diagnos och behandlingsplanering. Detta har fångat uppmärksamheten hos både tech-jättar och hälsoinrättningar.
Microsofts diskussioner med Epic, en ledande programvara för elektroniska hälsoregister, signalerar integrationen av LLM i hälsovården. Initiativ är redan på plats vid UC San Diego Health och Stanford University Medical Center. På liknande sätt har Googles samarbete med Mayo Clinic och Amazon (AMZN ) Web Services lansering av HealthScribe, en AI-klinisk dokumenttjänst, markerat betydande steg i denna riktning.
Men dessa snabba utrullningar väcker bekymmer om att lämna över kontrollen av medicinen till korporativa intressen. Den proprietära naturen hos dessa LLM gör dem svåra att utvärdera. Deras möjliga modifiering eller avbrott för profit skull kan kompromissa patientvård, integritet och säkerhet.
Det brådskande behovet är en öppen och inkluderande tillvägagångssätt för LLM-utveckling inom hälsovården. Hälsoinrättningar, forskare, kliniker och patienter måste samarbeta globalt för att bygga öppen källkods-LLM för hälsovården. Detta tillvägagångssätt, liknande Trillion Parameter Consortium, skulle tillåta poolning av beräknings-, finansiella resurser och expertis.













