Ajatusjohtajat

Kuinka hyvin LLM:t voivat todella päättää epäselvistä ongelmista?

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Generatiivisen tekoälyn ja sen evoluution aloittaminen ja kehittyminen ovat olleet niin äkkiä ja voimakasta, että on vaikea täysin arvostaa, kuinka paljon tämä teknologia on muuttanut elämäämme.

Zoomaa kolme vuotta taaksepäin. Kyllä, tekoäly oli jo tullut yleisemmäksi, ainakin teoriassa. Useammat ihmiset tunsivat joitakin asioita, joita se voisi tehdä, vaikka siinäkin oli valtavasti väärinkäsityksiä tekoälyn kyvyistä. Jotenkin teknologia sai samanaikaisesti liian vähän ja liian paljon luottamusta siitä, mitä se voisi saavuttaa. Silti keskivertoihmisen voisi osoittaa ainakin yhden tai kaksi aluetta, joilla tekoäly toimi, suorittaen erittäin erikoistuneita tehtäviä kohtuullisesti hyvin, hyvin kontrolloiduissa ympäristöissä. Mitään muuta kuin tätä ei ollut joko tutkimuslaboratoriossa tai se ei ollut olemassa.

Vertaa tätä nykytilanteeseen. Ilman muita taitoja kuin kykyä kirjoittaa lause tai kysyä kysymys, maailma on ulottuvillamme. Voimme luoda kuvia, musiikkia ja jopa elokuvia, jotka ovat todella yksilöllisiä ja upeita, ja joilla on kyky häiritä koko teollisuudenaloja. Voimme tehostaa hakukoneprosessiamme kysymällä yksinkertaista kysymystä, joka, jos se on muotoiltu oikein, voi luoda sivuja mukautettua sisältöä, joka on tarpeeksi hyvää voidakseen kulkea yliopistossa koulutetun tutkijan tai keskivertotason kolmannen luokan oppilaan … tai jos määrittelemme näkökulman, voimme saada vastauksen kysymykseen.

Monet ihmiset ovat kokeilleet generatiivista tekoälyä, kuten ChatGPT:ä, Midjourneya tai muita työkaluja. Toiset ovat jo ottaneet ne osaksi päivittäistä elämäänsä. Nämä ovat kehittyneet hämmästyttävän nopeasti, ja kehitys on ollut melkein hämmästyttävää. Ja kun otetaan huomioon viime kuuden kuukauden edistys, emme epäile, että tulemme olemaan vaikuttuneita yhä uudelleen seuraavien vuosien aikana.

Erityinen työkalu generatiivisessa tekoälyssä on ollut hakuja täydentävien generointijärjestelmien suorituskyky ja niiden kyky ajatella erityisesti monimutkaisia kysymyksiä läpi. FRAMES-tietojoukon esittely, josta kerrotaan tarkemmin artikkelissa, jossa kerrotaan, miten arviointitietojoukko toimii, osoittaa sekä, missä nykytila on, että mihin se on menossa. Jo FRAMESin julkaisun jälkeen useat alustat ovat rikkoneet uusia ennätyksiä kyvyssään ajatella vaikeiden ja monimutkaisten kysymysten parissa.

Selvitämmekö, mitä FRAMES on tarkoitettu arvioimaan ja miten hyvin eri generatiiviset tekoälymallit suoriutuvat. Voimme nähdä, miten sekä hajautetut että avoimet lähdekoodit kestävät kannassaan (erityisesti Sentient Chat), ja miten ne antavat käyttäjille mahdollisuuden nähdä yllättävän älykkään ajattelun, johon joissakin tekoälymalleissa pystytään.

FRAMES ikkuna GenAI-aivoihin

FRAMES-tietojoukko ja sen arviointiprosessi keskittyvät 824:ään “monihyppysys” -kysymykseen, joiden tarkoituksena on edellyttää johtamista, loogista yhdistämistä, useiden eri lähteiden käyttämistä tärkeän tiedon hakemiseksi ja kykyä yhdistää ne loogisesti yhteen vastaukseksi. Kysymyksiin tarvitaan 2-15 asiakirjaa, ja ne sisältävät tarkoituksella rajoituksia, matemaattisia laskelmia ja johtopäätöksiä sekä kykyä käsitellä aikaperusteista logiikkaa. Toisin sanoen, nämä kysymykset ovat erittäin vaikeita ja edustavat todellista maailmanlaajuista tutkimustyötä, jonka ihminen voi tehdä internetissä. Kohtaamme nämä haasteet jatkuvasti, ja meidän on etsittävä hajallaan olevia avainasioita internetin lähteistä, yhdistettävä tietoa eri sivustoilta, laskettava ja johtopäätöksiä tehtävä sekä ymmärrettävä, miten konsolidoida nämä tosiasiat oikeaksi vastaukseksi.

Mitä tutkijat löysivät, kun tietojoukko julkaistiin ja testattiin ensimmäisen kerran, oli, että parhaat GenAI-mallit pystyivät olemaan jossain määrin tarkkoja (noin 40 %) silloin, kun heidän piti vastata yksinkertaisilla menetelmillä, mutta pystyivät saavuttamaan 73 %:n tarkin, kun heille annettiin kaikki tarvittavat asiakirjat vastaamaan kysymyksiin. Kyllä, 73 % ei ehkä vaikuta vallankumoukselliselta. Mutta jos ymmärtää, mitä on vastattava, lukema tulee paljon vaikuttavammaksi.

Esimerkiksi yksi tietty kysymys on: “Mikä vuosi oli bändinjohtajan syntymävuosi, joka esitti alun perin laulun, jota Kanye Westin kappaleessa Power samplatti?” Miten ihminen lähestyisi tätä ongelmaa? Henkilö huomaisi, että heidän on kerättävä erilaisia tietoja, kuten Kanye Westin kappaleen Power sanoitukset, ja sitten heidän on etsittävä sanoituksista se kohta, jossa toista laulua samplataan. Me ihmiset voimme kuunnella laulun (jopa jos emme ole tuttuja siihen) ja todennäköisesti kyetä sanomaan, milloin toista laulua samplataan.

Mutta ajattele: mitä GenAI:lla pitäisi saavuttaa, jotta se voi havaita toisen laulun kuin alkuperäisen “kuunnellessaan” sitä? Tässä yksinkertainen kysymys muuttuu erinomaiseksi älykkään tekoälyn testiksi. Ja jos pystymme löytämään laulun, kuuntelemaan sitä ja tunnistamaan sanoitukset, jotka on samplattu, se on vain askel 1. Meidän on vielä selvitettävä, mikä laulu on, mikä bändi on, kuka bändin johtaja on ja mikä vuosi hänelle syntymävuosi on.

FRAMES osoittaa, että realististen kysymysten vastaamiseksi tarvitaan valtava määrä ajatteluprosessointia. Tässä on kaksi asiaa, jotka tulevat mieleen.

Ensinnäkin, hajautettujen GenAI-mallien kyky kilpailla, ja jopa hallita tuloksia, on uskomatonta. Kasvava määrä yrityksiä käyttää hajautettua menetelmää skaalatakseen prosessointikapasiteettiaan ja varmistamaan, että suuri yhteisö omistaa ohjelmiston eikä keskitetty musta laatikko, joka ei jaksa edistymistään. Yritykset kuten Perplexity ja Sentient johtavat tätä suuntausta, ja molemmat ovat kehittäneet vaikuttavia malleja, jotka suorittavat FRAMESin julkaisun jälkeen saavutettuja tarkkuusennätyksiä.

Toinen tekijä on, että osa näistä tekoälymalleista ei ole ainoastaan hajautettuja, vaan myös avoimia. Esimerkiksi Sentient Chat on molempia, ja varhaiset testit osoittavat, miten monimutkaisia niiden ajatteluprosessit voivat olla, ansiosta arvokkaita avoimia lähteitä. FRAMES-kysymys vastataan käyttäen melkein samaa ajatteluprosessia kuin ihminen, ja sen ajatteluprosessin yksityiskohdat ovat saatavilla tarkastelua varten. Ehkä vielä mielenkiintoisemmin, heidän alustansa on rakennettu useista malleista, jotka voivat hienosäätää tietyn näkökulman ja suorituskyvyn, vaikka hienosäätöprosessi joissakin GenAI-malleissa johtaa heikentyneeseen tarkkuuteen. Sentient Chatin tapauksessa on kehitetty useita eri malleja. Esimerkiksi viimeaikainen malli “Dobby 8B” pystyy sekä ylittämään FRAMESin vertailuarvon että kehittämään erityisen pro-krypto- ja pro-vapausasenteen, joka vaikuttaa mallin näkökulmaan, kun se prosessoi tietoa ja kehittää vastauksen.

Horisontissa

Avain kaikkiin näihin hämmästyttäviin innovaatioihin on nopeus, jolla olemme päässeet tähän. Meidän on tunnustettava, että niin nopeasti kuin tämä teknologia on kehittynyt, se kehittyy vain nopeammin lähitulevaisuudessa. Pystymme erityisesti hajautettujen ja avoimien GenAI-mallien avulla näkemään sen kriittisen kynnyksen, jossa järjestelmän älykkyys alkaa ylittää yhä enemmän omaa älykkyyttämme, ja mitä se tarkoittaa tulevaisuudelle.

David Balaban on tietoturvatutkija, jolla on yli 17 vuoden kokemus haittaohjelmien analyysistä ja virustorjuntaohjelmistojen arvioinnista. David johtaa MacSecurity.net ja Privacy-PC.com -projekteja, jotka esittävät asiantuntijalausuntoja nykyisistä tietoturva-asioista, mukaan lukien sosiaalinen insinööritaito, haittaohjelmat, penetraatiotestaus, uhkien tunnistaminen, verkkoyksityisyys ja valkoinen hattuhakkerointi. Davidilla on vankka tausta haittaohjelmien vianmäärityksessä, ja viimeaikaisessa keskittyminen on ollut kiristyssalkkujen vastaisissa toimissa.