AI-mallit ja alustat
Metan COCONUT: AI-menetelmä, joka ajattelee ilman kieltä
Kun tutkijat ensimmäisen kerran löysivät, että suuret kielen mallit (LLM) voivat “ajatella” askel askeleelta chain-of-thought-promptingin kautta, se oli läpimurtohetki – vihdoin voimme kurkistaa näiden mustien laatikoiden päättelyprosessiin. Mutta mitä jos sanon, että tekemällä AI-malleja ajattelemaan luonnollisella kielellä saattaa olla esteenä niiden kehitykselle?
Tämä on se, mitä Metan ja UC San Diegon tutkijat ovat löytäneet uudella COCONUT-menetelmällään (Chain of Continuous Thought).
Kuvittele yrittäessäsi ratkaista monimutkaisen matemaattisen ongelman ja samalla pakotessasi itsesi kuvailemaan jokaisen yksittäisen askelen ääneen. Häiritsevää, eikö?
Kun teemme AI-malleja ajattelemaan luonnollisella kielellä:
- Useimmat tokenit, joita ne generoivat, ovat vain kielellistä liimaa – sanat kuten “siis”, “seuraavaksi” ja “tästä syystä”, jotka eivät lisää mitään päättelyarvoa
- Kriittiset päätöksentekoprosessit joutuvat pulittamaan kielen käytön vuoksi
- Malli käyttää merkittävää laskentakapasiteettia kieliopillisen yhdenmukaisuuden ylläpitämiseen sen sijaan, että se keskittyisi itse ongelmanratkaisuun
Tutkijat löysivät mielenkiintoisen asian neuroimaging-tutkimuksissaan: kun ihmiset ratkaisevat monimutkaisia päättelytehtäviä, kielen keskukset aivoissamme usein pysyvät yllättävän hiljaisina. Mutta me olemme rakentaneet AI-järjestelmiä, jotka tekevät vastakkaisen – pakottaen ne kääntämään jokaisen päättelyaskelen sanoiksi.
Ajattele, miten ratkaiset palapelin. Mieleesi todennäköisesti tulee useita mahdollisuuksia samanaikaisesti, ylläpidät epäselviä hypoteeseja ja kiteyität ajatuksesi kielen muotoon vasta kun jaat ratkaisun. Mutta perinteiset chain-of-thought-lähestymistavat pakottavat AI-mallit kuvailemaan jokaisen välimuodon sanoin, luoden “kielisen pullonkaulan”.
Tämä oivallus johti mielenkiintoiseen kysymykseen: Mitä jos voisimme antaa AI-malleille ajatella omalla “kielellä” – jatkuvaan, korkean dimensionaalisuuden latenttiavaruuteen – sen sijaan, että pakottaisimme ne kääntämään kaiken tokeneiksi?
Ymmärtäminen COCONUT-innovaatiosta
Kuvittele eroa puhumisen ja ajattelun välillä. Se aukko – puhutuissa ajatuksissa ja aivojen toiminnassa – on juuri se, mihin Metan tutkijat tarttuivat COCONUTilla.
COCONUTin oikea läpimurto piilee siinä, miten se antaa AI-malleille ajatella kahdella eri tavalla, aivan kuten ihmiset. Ajattele, kun ratkaiset monimutkaisen palapelin – et kai kuvaile jokaisen mahdollisen siirron ääneen?
- Ota vastaan ongelma: Otat tiedon (kuten luet palapelin säännöt)
- Ajattele hiljaa: Aivosi tutkii useita mahdollisuuksia ilman, että lausut niitä ääneen
- Jaa ratkaisu: Vasta sitten selität ajatteluprosessisi muille
COCONUT antaa AI-malleille saman luonnollisen joustavuuden. Sen sijaan, että se pakottaisi ne “puhumaan” jokaisen ajatuksen ääneen (kuten perinteiset menetelmät tekevät), se antaa niiden ajatella luonnollisessa neuroavaruudessaan – mitä tutkijat kutsuvat “latenttiavaruudeksi”.
Malli siirtyy sulavasti kahden tilan välillä:
- Kun se tarvitsee ymmärtääkseen kysymyksiä tai antaa vastauksia, se käyttää säännöllistä kieltä
- Mutta itse ajatteluprosessiin? Se käyttää puhdasta neurologista kuviota, joka on vapaa kielen rajoituksista

Kuva: Meta
Koulutusmatka
Yksi COCONUTin mielenkiintoisimmista puolista on sen koulutusohjelma. Se, mikä tekee tästä erityisen, on se, miten se heijastaa luonnollista oppimisprosessia. Ajattele, miten opetamme monimutkaisia taitoja – et heittäisi ketään välittömästi syvään päänsä. Rakennamme asteittain, lisäten monimutkaisuutta, kunnes he hallitsevat jokaisen tason.
Tutkijat ottivat tämän lähestymistavan COCONUTissa:
Vaihe 1: Perusta
Ensinnäkin, malli oppii kuten muutkin AI-mallit – perinteisen chain-of-thought-päättelyn kautta. Tämä antaa sille vankkaan perustan ymmärtämiseen.
Vaihe 2: Siirtymä
Tässä vaiheessa asiat muuttuvat mielenkiintoisiksi. Vähitellen, kirjoitetut päättelyaskelten tilalla tulee jatkuva ajattelu. Kuvittele hitaasti poistamassa harjoitusrattaat, antaen mallin kehittää oman sisäisen ajattelumallinsa.
Vaihe 3: Tasapaino
Lopulta, malli oppii siirtymään täydellisesti latenttiavaruuden syvän ajattelun ja selkeän kielen välillä.
Koulutuksen aikana malli kehitti kykyjä, joita kukaan ei ollut ohjelmoinut – kuten tarkastelemalla useita päättelyreittejä samanaikaisesti. Tämä emergentti käyttäytyminen on erityisen mielenkiintoista, koska se viittaa siihen, että saattaisimme olla lähempänä luonnollisempia AI-päättelymuotoja. Nämä odottamattomat kehityssuunnat johtavat usein suurimpiin läpimurtoihin.
Muistatko neuroimaging-tutkimukset, joista mainitsin aiemmin? Ne osoittivat, että ihmisaivot usein prosessivat monimutkaisia päättelytehtäviä ilman, että kielen keskukset osallistuvat voimakkaasti. COCONUT näyttää kehittyvän samankaltaisilla linjoilla – ajattelemalla syvällisesti omassa neuroavaruudessaan ja muuttaen kielen vain silloin, kun se on tarpeen viestintään.
Luvut kertovat tarinan
Joitakin muita avainlöytöjä korostuu tutkimuksessa:
- Matemaattiset sanalliset ongelmat (GSM8k): Tässä COCONUT saavutti 34,1 prosentin tarkin. Vaikka se on alle perinteisen Chain-of-Thoughtin (42,9 prosenttia), se on merkittävästi parempi kuin peruslähestymistavat.
- Looginen päättely (ProntoQA): COCONUT saavutti 99,8 prosentin tarkin. Se ohitti perinteisen Chain-of-Thoughtin (98,8 prosenttia) ja teki sen vain 9 tokenilla verrattuna CoT:n 92,5:een.
- Monimutkainen suunnittelu (ProsQA): Vaikuttavimmat tulokset tulivat tästä edistyneestä päättelytestistä. COCONUT saavutti 97 prosentin tarkin ja perinteiset menetelmät vain 77,5 prosenttia. Se teki sen myös vaikuttavalla tehokkuudella – 14,2 tokenia verrattuna 49,4:ään.
Nämä tulokset ovat lupaavia, koska ne paljastavat eri ajattelutapojen eroja. Vaikka COCONUT saattaa vielä etsiä jalansijaa matemaattisessa päättelyssä, se erinomaisesti suoriutuu tehtävistä, jotka vaativat monimutkaista loogista suunnittelua ja päättelyä.
COCONUT edustaa perustavanlaatuista uudelleenajattelua siitä, miten AI-järjestelmät voivat ajatella, ja se vie meidät lähemmäs luonnollisempia, tehokkaampia ja voimakkaampia tekoälymuotoja. Matka kielenpohjaisesta päättelystä jatkuvaan ajatteluun on askel kohti kykympää ja tehokkaampaa AI-järjestelmää.












