Andersonin kulma
Uusi tutkimus paljastaa kuusitoista suurta ongelmaa RAG-järjestelmissä, mukaan lukien Perplexity

Yhdysvalloista löytyneen tuoreen tutkimuksen mukaan suosittujen Retrieval Augmented Generation (RAG) -tutkimusjärjestelmien, kuten Perplexityn ja Bing Copilotin, todellinen suorituskyky on paljon heikompi kuin niiden markkinointihype ja suosio, joka on ollut otsikoissa viimeisen 12 kuukauden aikana.
Tutkimus, johon osallistui 21 asiantuntijaa, löysi 16 aluetta, joissa tutkitut RAG-järjestelmät (You Chat, Bing Copilot ja Perplexity) aiheuttivat huolta:
1: Objektiivisen yksityiskohtaisuuden puute vastauksissa, joissa oli yleisiä yhteenvetoja ja vähän kontekstuaalista syvyyttä tai nuansseja.
2. Käyttäjän näkemyksen vahvistaminen, jossa RAG-moottori usein ei esittänyt erilaisia näkemyksiä, vaan sen sijaan seurasi ja vahvisti käyttäjän näkemyksen, joka perustui siihen, miten käyttäjä muotoili kysymyksensä.
3. Liian itsevarma kieli, erityisesti subjektiivisissa vastauksissa, joita ei voida todistaa empiirisesti, mikä voi johtaa siihen, että käyttäjä luottaa vastaukseen enemmän kuin se ansaitsee.
4: Yksinkertainen kieli ja kriittisen ajattelun ja luovuuden puute, jossa vastaukset olivat yksinkertaisia ja sopivia, eivätkä tarjonneet ajattelua ja analyysiä.
5: Lähteiden virheellinen merkintä ja viittaus, jossa vastausmoottori käytti lähteitä, jotka eivät tukeneet vastausta, luoden illuusion uskottavuudesta.
6: Tietojen valikointi kysymyksen mukaan, jossa RAG-vastaaja etsi vastauksia, jotka tukivat sen väittämää ja sen arviota siitä, mitä käyttäjä halusi kuulla, sen sijaan että se perustui objektiiviseen analyysiin luotettavista lähteistä.
7: Lähteiden puute, jotka tukivat väittämää, jossa lähteet puuttuivat.
8: Ei loogista skeemaa vastauksille, jossa käyttäjät eivät voineet kysyä, miksi järjestelmä priorisoi tiettyjä lähteitä muiden lähteiden sijaan.
9: Rajoitettu määrä lähteitä, jossa useimmat RAG-järjestelmät tarjosivat vain kolme lähdettä väittämälle, vaikka useampi lähteiden moninaisuus olisi ollut sovellettavissa.
10: Orpoja lähteitä, jossa järjestelmän tukilähteiden tiedot eivät olleet mukana vastauksessa.
11: Epäluotettavien lähteiden käyttö, jossa järjestelmä suosi lähdettä, joka oli suosittu (ts. hakukoneoptimoinnin kannalta) sen sijaan, että se olisi ollut todenperäinen.
12: Redundanttilähteitä, jossa järjestelmä esitti useita viittauksia, joissa lähdet olivat käytännössä saman sisältöisiä.
13: Suodattamattomia lähteitä, jossa järjestelmä ei tarjonnut käyttäjälle mahdollisuutta arvioida tai suodattaa tarjottuja lähteitä, pakottaen käyttäjän luottamaan valintakriteereihin.
14: Vuorovaikutuksen ja tutkimuksen puute, jossa useat käyttäjät olivat pettyneitä, että RAG-järjestelmät eivät kysyneet tarkentavia kysymyksiä, vaan olettivat käyttäjän aikomuksen ensimmäisestä kysymyksestä.
15: Ulkoisen verifioinnin tarve, jossa käyttäjät kokivat tarpeen tehdä itsenäinen verifiointi tarjotuista vastauksista, mikä poisti RAG:n oletetun käytön “korvaavan hakukoneen” käytön.
16: Akateemisten viittausmenetelmien käyttö, kuten [1] tai [34], jotka ovat standardia akateemisissa piireissä, mutta voivat olla epäselviä monille käyttäjille.
Tutkimuksessa osallistui 21 asiantuntijaa, jotka olivat joko post-doktorin tutkijoita tai väitöskirjatutkijoita, ja he edustivat eri aloja, kuten tietotekniikkaa, terveydenhuoltoa, lääketiedettä, soveltavaa tieteen ja koulutusta sekä yhteiskuntatieteitä.
Tutkimuksen menetelmä oli systemaattinen ja se koostui kahdesta osasta: ensin asiantuntijat osallistuivat kyselyyn, jossa heidän ajatuksensa ja toimintansa tallennettiin, ja sitten tutkijat analysoivat tuloksia.
Tutkimuksessa käytettiin myös automaattista menetelmää, jossa RAG-järjestelmien vastauksia analysoitiin ja arvioitiin niiden suorituskyky.
Tutkimuksen tulokset osoittivat, että RAG-järjestelmät eivät suoriudu hyvin useissa mittareissa, kuten vastausten objektiivisuudessa, lähteiden tarkkuudessa ja vastausten luotettavuudessa.
Tutkimuksen johtopäätöksistä voidaan todeta, että RAG-järjestelmien kehittämisessä on vielä paljon parantamisen varaa, ja niiden suorituskykyä tulee parantaa, jotta ne voisivat toimia luotettavasti ja objektiivisesti.
RAG-kauppa
Tutkimuksessa tarkasteltiin myös RAG-järjestelmien kaupallista potentiaalia ja niiden mahdollisuuksia markkinoilla.
Tutkimuksen mukaan RAG-järjestelmien markkinat ovat kasvamassa, ja niiden suosio on lisääntymässä.
Tutkimuksessa todettiin myös, että RAG-järjestelmien kehittäminen vaatii yhteistyötä eri alojen asiantuntijoiden välillä, jotta niiden suorituskykyä voidaan parantaa ja niiden luotettavuutta voidaan lisätä.
Tutkimus
Tutkimuksessa tarkasteltiin RAG-järjestelmien suorituskykyä ja niiden mahdollisuuksia eri aloilla.
Tutkimuksen mukaan RAG-järjestelmien suorituskyky on parantunut viime aikoina, mutta niiden luotettavuus on edelleen heikko.
Tutkimuksessa todettiin myös, että RAG-järjestelmien kehittäminen vaatii jatkuvaa tutkimusta ja kehittämistä, jotta niiden suorituskykyä voidaan parantaa ja niiden luotettavuutta voidaan lisätä.
Objektiivisen yksityiskohtaisuuden puute
Tutkimuksessa todettiin, että RAG-järjestelmien vastauksissa oli usein objektiivisen yksityiskohtaisuuden puute.
Tämä puute johtui siitä, että RAG-järjestelmät eivät kyenneet tarjoamaan riittävän tarkkoja ja yksityiskohtaisia vastauksia.
Näkemyksen vahvistaminen
Tutkimuksessa todettiin, että RAG-järjestelmät vahvistivat usein käyttäjän näkemyksen sen sijaan, että ne esittivät erilaisia näkemyksiä.
Tämä vahvistaminen johtui siitä, että RAG-järjestelmät eivät kyenneet tarjoamaan riittävän monipuolisia ja objektiivisia vastauksia.
Liian itsevarma kieli
Tutkimuksessa todettiin, että RAG-järjestelmien vastauksissa oli usein liian itsevarma kieli.
Tämä itsevarmuus johtui siitä, että RAG-järjestelmät eivät kyenneet tarjoamaan riittävän varovaisia ja objektiivisia vastauksia.
Virheellinen viittaus
Tutkimuksessa todettiin, että RAG-järjestelmien vastauksissa oli usein virheellinen viittaus.
Tämä virheellinen viittaus johtui siitä, että RAG-järjestelmät eivät kyenneet tarjoamaan riittävän tarkkoja ja luotettavia lähteitä.
Tietojen valikointi
Tutkimuksessa todettiin, että RAG-järjestelmät valikoivat usein tietoja, jotka tukivat niiden omia väittämiä sen sijaan, että ne esittivät objektiivisia ja monipuolisia vastauksia.
Automaattinen RAG
Tutkimuksessa tarkasteltiin myös automaattisen RAG-järjestelmän suorituskykyä.
Tutkimuksen mukaan automaattinen RAG-järjestelmä kykeni tarjoamaan objektiivisia ja monipuolisia vastauksia, mutta sen suorituskyky oli edelleen heikko.
Tutkimuksessa todettiin myös, että automaattisen RAG-järjestelmän kehittäminen vaatii jatkuvaa tutkimusta ja kehittämistä, jotta sen suorituskykyä voidaan parantaa ja sen luotettavuutta voidaan lisätä.












