AI-modellen en platforms
ChatGPT’s Eerste Verjaardag: De Toekomst van AI-Interactie Herschapen
Terugkijkend op ChatGPT’s eerste jaar, is het duidelijk dat dit hulpmiddel de AI-scene aanzienlijk heeft veranderd. Gelanceerd aan het einde van 2022, onderscheidde ChatGPT zich door zijn gebruikersvriendelijke, conversationalistische stijl die het interactie met AI meer liet aanvoelen als een gesprek met een persoon dan met een machine. Deze nieuwe benadering trok snel de aandacht van het publiek. Binnen vijf dagen na de release had ChatGPT al een miljoen gebruikers aangetrokken. Begin 2023 was dit aantal gestegen tot ongeveer 100 miljoen maandelijkse gebruikers, en tegen oktober trok de platform ongeveer 1,7 miljard bezoeken wereldwijd. Deze cijfers spreken boekdelen over zijn populariteit en bruikbaarheid.
In het afgelopen jaar hebben gebruikers allerlei creatieve manieren gevonden om ChatGPT te gebruiken, van eenvoudige taken zoals het schrijven van e-mails en het bijwerken van cv’s tot het starten van succesvolle bedrijven. Maar het gaat niet alleen om hoe mensen het gebruiken; de technologie zelf is gegroeid en verbeterd. Aanvankelijk was ChatGPT een gratis dienst die gedetailleerde tekstantwoorden bood. Nu is er ChatGPT Plus, dat ChatGPT-4 omvat. Deze bijgewerkte versie is getraind op meer gegevens, geeft minder verkeerde antwoorden en begrijpt complexe instructies beter.
Een van de grootste updates is dat ChatGPT nu op meerdere manieren kan communiceren – het kan luisteren, spreken en zelfs afbeeldingen verwerken. Dit betekent dat u via de mobiele app met het kan praten en afbeeldingen kunt laten zien om antwoorden te krijgen. Deze veranderingen hebben nieuwe mogelijkheden voor AI geopend en hebben de manier waarop mensen naar de rol van AI in hun leven kijken, veranderd.
Van zijn begin als technische demo tot zijn huidige status als een belangrijke speler in de technologie, is ChatGPT’s reis behoorlijk indrukwekkend. Aanvankelijk werd het gezien als een manier om technologie te testen en te verbeteren door feedback van het publiek te krijgen. Maar het werd snel een essentieel onderdeel van het AI-landschap. Dit succes toont aan hoe effectief het is om grote taalmodellen (LLM’s) te fijnafstemmen met zowel begeleide als onbegeleide leermethoden en feedback van mensen. Als gevolg hiervan kan ChatGPT een breed scala aan vragen en taken afhandelen.
De race om de meest capabele en veelzijdige AI-systemen te ontwikkelen, heeft geleid tot een toename van zowel open-source als propriëtaire modellen zoals ChatGPT. Het begrijpen van hun algemene mogelijkheden vereist uitgebreide benchmarks over een breed spectrum van taken. Deze sectie onderzoekt deze benchmarks en werpt licht op hoe verschillende modellen, waaronder ChatGPT, zich verhouden tot elkaar.
LLM’s Evalueren: De Benchmarks
- MT-Bench: Deze benchmark test de mogelijkheden voor meerdere conversatieronden en instructievolging over acht domeinen: schrijven, rolspel, informatie-extractie, redeneren, wiskunde, programmeren, wetenschappelijke kennis en geesteswetenschappen. Sterkere LLM’s zoals GPT-4 worden gebruikt als evaluatoren.
- AlpacaEval: Gebaseerd op de AlpacaFarm-evaluatieset, benchmarkt deze LLM-gebaseerde automatische evaluator modellen tegen antwoorden van geavanceerde LLM’s zoals GPT-4 en Claude, en berekent de winstpercentage van kandidaatmodellen.
- Open LLM Leaderboard: Met behulp van de Language Model Evaluation Harness, evalueert deze leaderboard LLM’s op zeven belangrijke benchmarks, waaronder redeneeruitdagingen en algemene kennis-tests, in zowel zero-shot als few-shot settings.
- BIG-bench: Deze gezamenlijke benchmark omvat meer dan 200 nieuwe taaltaken, die een diverse reeks onderwerpen en talen bestrijken. Het doel is om LLM’s te onderzoeken en hun toekomstige mogelijkheden te voorspellen.
- ChatEval: Een multi-agent debatframework dat teams in staat stelt om onafhankelijk te discussiëren en de kwaliteit van antwoorden van verschillende modellen op open-vraag en traditionele natuurlijke taalgeneratie-taken te evalueren.
Vergelijkende Prestaties
In termen van algemene benchmarks hebben open-source LLM’s aanzienlijke vooruitgang geboekt. Llama-2-70B, bijvoorbeeld, behaalde indrukwekkende resultaten, vooral na fijnafstemming met instructiegegevens. Zijn variant, Llama-2-chat-70B, blonk uit in AlpacaEval met een winstpercentage van 92,66%, waarmee GPT-3.5-turbo werd overtroffen. GPT-4 blijft echter de leider met een winstpercentage van 95,28%.
Zephyr-7B, een kleiner model, toonde capaciteiten die vergelijkbaar zijn met die van grotere 70B LLM’s, vooral in AlpacaEval en MT-Bench. WizardLM-70B, dat was gefinetuned met een diverse reeks instructiegegevens, scoorde het hoogst onder open-source LLM’s op MT-Bench. Het bleef echter nog steeds achter bij GPT-3.5-turbo en GPT-4.
Een interessante inzending, GodziLLa2-70B, behaalde een concurrerend score op de Open LLM Leaderboard, waarmee het potentieel van experimentele modellen die diverse datasets combineren, werd aangetoond. Evenzo blonk Yi-34B, dat van scratch was ontwikkeld, uit met scores die vergelijkbaar waren met die van GPT-3.5-turbo en slechts iets lager dan GPT-4.
UltraLlama, met zijn fijnafstemming op diverse en hoogwaardige gegevens, evenaarde GPT-3.5-turbo in de voorgestelde benchmarks en overtrof het zelfs op gebieden van wereld- en professionele kennis.
Op Schaal Verhogen: De Opkomst van Reusachtige LLM’s
Een opvallende trend in de ontwikkeling van LLM’s is de toename van modelparameters. Modellen zoals Gopher, GLaM, LaMDA, MT-NLG en PaLM hebben de grenzen verlegd, wat heeft geresulteerd in modellen met tot 540 miljard parameters. Deze modellen hebben uitzonderlijke capaciteiten getoond, maar hun gesloten karakter heeft de bredere toepassing beperkt. Deze beperking heeft de interesse in het ontwikkelen van open-source LLM’s aangewakkerd, een trend die aan het toenemen is.
Naast het opschalen van modelgroottes, hebben onderzoekers alternatieve strategieën onderzocht. In plaats van modellen alleen maar groter te maken, hebben ze zich gericht op het verbeteren van de vooraftraining van kleinere modellen. Voorbeelden hiervan zijn Chinchilla en UL2, die hebben aangetoond dat meer niet altijd beter is; slimmere strategieën kunnen efficiënte resultaten opleveren. Bovendien is er aanzienlijke aandacht besteed aan instructieafstemming van taalmodellen, met projecten zoals FLAN, T0 en Flan-T5 die significante bijdragen aan dit gebied hebben geleverd.
De ChatGPT-Katalysator
De introductie van OpenAI’s ChatGPT markeerde een keerpunt in het NLP-onderzoek. Om concurrerend te zijn met OpenAI, lanceerden bedrijven zoals Google (GOOGL ) en Anthropic hun eigen modellen, Bard en Claude, respectievelijk. Hoewel deze modellen vergelijkbare prestaties laten zien als ChatGPT in veel taken, blijven ze nog steeds achter bij de laatste model van OpenAI, GPT-4. Het succes van deze modellen wordt voornamelijk toegeschreven aan versterkt leren van menselijke feedback (RLHF), een techniek die steeds meer onderzoek krijgt voor verdere verbetering.
Geruchten en Speculaties Rondom OpenAI’s Q* (Q-Star)
Recente rapporten suggereren dat onderzoekers bij OpenAI mogelijk een significante doorbraak in AI hebben behaald met de ontwikkeling van een nieuw model genaamd Q* (uitgesproken als Q-ster). Volgens de geruchten heeft Q* de mogelijkheid om wiskunde op basisschoolniveau uit te voeren, een prestatie die discussies onder experts heeft aangewakkerd over zijn potentieel als een mijlpaal op weg naar kunstmatige algehele intelligentie (AGI). Hoewel OpenAI geen commentaar heeft geleverd op deze rapporten, hebben de vermeende capaciteiten van Q* aanzienlijke opwinding en speculatie op sociale media en onder AI-enthousiasten gegenereerd.
De ontwikkeling van Q* is opmerkelijk omdat bestaande taalmodellen zoals ChatGPT en GPT-4, hoewel in staat om sommige wiskundetaken uit te voeren, niet bijzonder goed zijn in het betrouwbaar uitvoeren van deze taken. De uitdaging ligt in de noodzaak voor AI-modellen om niet alleen patronen te herkennen, zoals ze dat nu doen via diepe leer- en transformatietechnieken, maar ook om te redeneren en abstracte concepten te begrijpen. Wiskunde, als een benchmark voor redeneren, vereist dat de AI plannen en meerdere stappen uitvoert, waarmee een diep begrip van abstracte concepten wordt aangetoond. Deze capaciteit zou een significante sprong in AI-mogelijkheden markeren, mogelijk uitstrekkend tot verder dan wiskunde naar andere complexe taken.
Desondanks waarschuwen experts tegen het te veel opheffen van deze ontwikkeling. Hoewel een AI-systeem dat betrouwbaar wiskundeproblemen oplost een indrukwekkende prestatie zou zijn, betekent dit niet noodzakelijk het begin van superintelligente AI of AGI. Huidig AI-onderzoek, inclusief inspanningen van OpenAI, heeft zich gericht op elementaire problemen, met variabele successen in complexere taken.
De potentiële toepassingen van doorbraken zoals Q* zijn uitgebreid, variërend van gepersonaliseerde tutoring tot het ondersteunen van wetenschappelijk onderzoek en engineering. Echter, het is ook belangrijk om verwachtingen te managen en de beperkingen en veiligheidszorgen in verband met dergelijke doorbraken te erkennen. De zorgen over AI die bestaansrisico’s vormt, een fundamentele zorg van OpenAI, blijven relevant, vooral nu AI-systemen meer met de echte wereld in contact komen.
De Open-Source LLM-Beweging
Om open-source LLM-onderzoek te stimuleren, heeft Meta de Llama-serie modellen vrijgegeven, wat een golf van nieuwe ontwikkelingen op basis van Llama heeft ontketend. Dit omvat modellen die zijn gefinetuned met instructiegegevens, zoals Alpaca, Vicuna, Lima en WizardLM. Onderzoek breidt zich ook uit naar het verbeteren van agentcapaciteiten, logische redenering en lange-contextmodellering binnen het Llama-gebied.
Verder is er een groeiende trend in het ontwikkelen van krachtige LLM’s van scratch, met projecten zoals MPT, Falcon, XGen, Phi, Baichuan, Mistral, Grok en Yi. Deze inspanningen weerspiegelen een toewijding om de capaciteiten van gesloten LLM’s te democratiseren, waardoor geavanceerde AI-hulpmiddelen toegankelijker en efficiënter worden.
De Invloed van ChatGPT en Open-Source Modellen in de Gezondheidszorg
We kijken naar een toekomst waarin LLM’s helpen bij klinische notities, formulieren voor vergoedingen en ondersteunen artsen bij diagnose en behandelplanning. Dit heeft de aandacht getrokken van zowel technologiebedrijven als gezondheidsinstellingen.
Microsofts gesprekken met Epic, een toonaangevende softwareprovider voor elektronische gezondheidsdossiers, geven aan dat LLM’s in de gezondheidszorg worden geïntegreerd. Initiatieven zijn al gaande bij UC San Diego Health en Stanford University Medical Center. Evenzo markeren Google’s samenwerking met Mayo Clinic en Amazon (AMZN ) Web Services’ lancering van HealthScribe, een AI-gebaseerde klinische documentatiedienst, significante stappen in deze richting.
Desondanks roepen deze snelle implementaties zorgen op over het afstaan van controle over de geneeskunde aan corporate-belangen. De propriëtaire aard van deze LLM’s maakt het moeilijk om ze te evalueren. Hun mogelijke wijziging of stopzetting om winst te behalen, kan de zorg voor patiënten, privacy en veiligheid in gevaar brengen.
De dringende behoefte is aan een open en inclusieve benadering van LLM-ontwikkeling in de gezondheidszorg. Gezondheidsinstellingen, onderzoekers, clinici en patiënten moeten wereldwijd samenwerken om open-source LLM’s voor de gezondheidszorg te ontwikkelen. Deze benadering, vergelijkbaar met de Trillion Parameter Consortium, zou het mogelijk maken om computermiddelen, financiële middelen en expertise te combineren.













