Ajatusjohtajat

Todellinen syy, miksi RAG-putkijohtosi jatkuvaan hallusinoi

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Tiedät rituaalin. Putkijohto hallusinoi asiakkaan edessä, joten vaihdoit sisäänrakennetun mallin. Sitten päivitit LLM:n. Sitten lisäsit järjestelmäkäskyn, joka sanoo yhä epätoivoisemmin isoilla kirjaimilla: KÄYTÄ VAIN TARJOITETTUUNTA YHTENÄISÖÄ. Ja tänä aamuna se mainitsi varmasti asiakirjan, jota ei ole olemassa.

Olet hyvissä seurassa. Kun Stanfordin RegLab ja HAI-tutkijat tarkastivat LexisNexisin ja Thomson Reutersin myymiä oikeudellisia tutkimustyökaluja, tuotteita, jotka on markkinoitu “hallusinaatiottomina” kiitos hakuvahvistetun luomisen, he löysivät hallusinaatiolukujen olleen 17% ja 34% ennalta määritetyillä oikeudellisilla kysymyksillä. RAG todella auttoi: raaka GPT-4 hallusinoi paljon enemmän. Mutta välinen ero “vähennetyssä” ja “poistetussa” on siellä, missä tuotantojärjestelmät toimivat, ja sillä on rakenne.

(TRI )

Hallusinaatio RAG-putkijohtossa on harvoin yksittäinen virhe. Se on kolme salaliittolaista: hakuvirhe, malli on koulutettu vastaamaan joka tapauksessa, ja mitään putkijohtossa ei mitata näiden kahden tosiasian välistä tilaa. Mallin vaihtaminen ei ratkaise näitä ongelmia.

Salaliittolainen yksi: hakuvirhe on yleisempi kuin luulet

Tuorein näyttö tältä alueelta on myös epämukavuin. Marraskuussa 2025 joukko, johon kuului 18 lääketieteellistä asiantuntijaa, tuotti 80 502 annotaatiota 800 RAG-lähdössä oikeilla potilas- ja USMLE-tyyppisillä kysymyksillä. Standardi-RAG ei ainoastaan pettänyt; se heikensi tosiasiallisuutta jopa 6% ja täydellisyyttä 5% verrattuna samaan malliin ilman hakua. Juuri alkuperäinen syy maksoi kokonaan LLM:n ulkopuolella: vain 22% 16 parhaasta haetusta kappaleesta liittyi kysymykseen.

Ennen kuin hylkäät tämän vaikeana alueena, Anthropic mittasi hakuvirheen puhdistetuilla ja kuratoituilla aineistoilla kehittäessään kontekstuaalista hakutekniikkaa ja havaitsi, että standardi- sisäänrakennettu hakukäynti epäonnistui löytämään tarvittavaa palaa 20 parhaan tuloksen joukosta 5,7%:ssa tapauksissa. Yksi kysymys kahdeksasta, puhdistetuilla aineistoilla, ilman mitään eksoottista toimintaa.

Tämä on myös miksi RAG-epäonnistumisen kanoninen insinööritaksonomia, Barnett et al.:n seitsemän epäonnistumispistettä, on niin tärkeää: kolme seitsemästä (puuttuva sisältö, väärät ylätasoiset asiakirjat ja yhtenäistämisepäonnistumiset) tapahtuvat ennen kuin kielen malli tuottaa yhtään symbolia. Unite.AI on julkaissut tarkan katsauksen tähän taksonomiaan ja siihen liittyviin arviointikehyksiin, joten en rakenna sitä uudelleen tässä. Asia, jonka tämä artikkeli lisää, liittyy kannustimiin: sisäänrakennettu samankaltaisuus on vain viitekehyksellinen osoitin, ei takuu relevanssista, ja Google DeepMindin viimeaikainen teoreettinen työ osoittaa, että yksittäiset vektorigraafiset sisäänrakennukset ovat matemaattisesti rajoitettuja siinä, mitä relevantteja asiakirjoja ne voivat edustaa. Hakija, joka palauttaa uskottavan, mutta väärän palan, tekee vain sitä, mihin kosinussamankaltaisuus perustuu.

Salaliittolainen kaksi: malli on koulutettu arvaamaan

Nyt anna virheellinen konteksti kielimallille ja kysy, mitä mallin koulutus on opettanut sille tekemään aukkojen kanssa.

OpenAI vastasi tähän suoraan syyskuun 2025 tutkimuksessaan Miksi kielimallit hallusinoivat: standardikoulutus ja arviointi palkitsevat arvaamista enemmän kuin epävarmuuden tunnustamista. Vertailuarvot pisteyttävät binäärisen tarkkuuden, pidättyminen pisteyttää nollan, ja näin ollen mallit oppivat, että rohkea arvaus voittaa tyhjän. Tutkimuksen oma vertailu tekee sen konkreettiseksi: SimpleQA:lla yksi päättelymalli pidättyi 1%:ssa tapauksista ja oli väärä 75%:ssa tapauksista, kun taas toisin säätelty sisarus pidättyi 52%:ssa tapauksista ja leikkasi virhelukunsa 26%:iin.

RAG-spesifiset vertailuarvot osoittavat, mitä tämä kannustimella tekee putkijohtossa. RGB-vertailu testasi, kieltäytyykö mallit vastaamasta, kun niille annettiin ainoastaan epäolennaisia asiakirjoja. Parhaan kielletyn hylkäysprosentin kaikissa testatuissa malleissa oli 45%, mikä tarkoittaa, että jopa paras malli, jolle annettiin pelkästään roskaa, vastasi silti useammin kuin puolet ajasta. ClashEval löysi peilin: kun haettu sisältö ristiriitaisi tietoa, jonka malli jo tiesi oikein, mallit hylkäsivät oikean vastauksensa ja valitsivat väärän kontekstin yli 60%:ssa tapauksista. Uskollisuus epäonnistuu molemmilla tavoilla, ja Salesforcen FaithEval lisää häiritsevän coda, jonka mukaan suuremmat mallit eivät ole luotettavasti uskollisempia.

Anthropicsin tulkinnaistyöryhmä on jopa jäljittänyt mekanismin. Heidän analyysissään kieltäytyminen on mallin oletusarvoinen piiri; “tunnetun olion” ominaisuus estää kieltäytymisen, kun malli tunnistaa jotain. Hallusinaatio tapahtuu, kun ominaisuus laukaisee virheen, kun malli tunnistaa kysymyksen muodon, puuttuu aineisto, ja keksii sulavasti aukkoon.

Ja jos toivot, että eturintama yksinkertaisesti kasvaa tästä yli: Vectaran hallusinaatiolista mittaa jotain paljon helpompaa kuin RAG, yhteenvedon yhdestä asiakirjasta, joka on asetettu suoraan mallin eteen, ja toukokuun 2026 päivityksestä lähtien GPT-4o vielä keksii 9,6%:ssa yhteenvetoja ja Claude Opus 4 12%:ssa. Jopa kun hakua on ratkaistu täydellisesti, generointi vuotaa.

Luonnollinen korjaus tekee asiasta huonomman

Kohdatessasi tätä, useimmat tiimit tarttuvat määrään. Hae enemmän paloja. Osta suurempi kontekstiruutu. Täytä kaikki, mikä saattaa auttaa, ja anna mallin järjestää sen.

Todisteet kulkevat vastakkaiseen suuntaan. Chroman kontekstivirheen tutkimus testasi 18 mallia, mukaan lukien GPT-4.1, Claude 4 ja Gemini 2.5, ja totesi, että suorituskyky kasvaa “yhä epäluotettavammaksi, kun syötteen pituus kasvaa”, ja yksi häiritsevä asiakirja leikkasi tarkkuuden merkittävästi ja neljä häiritsevää asiakirjaa leikkasi sen olennaisesti. Aikaisempi Lost in the Middle -tutkimus löysi kuuluisan U-käyrän: keskellä oleva tieto jää huomiotta, jopa pitkän kontekstin malleilla. Ja edellä mainittu lääketieteellinen tarkastus on näin näyttää lopusta loppuun, järjestelmä, joka hakee 16 kappaletta, joista yli 12 on epäolennaisia, ja sitten antaa pinon mallille, joka on koulutettu vastaamaan “en tiedä” -vastauksia.

Lisää hakua ilman tarkkuutta vain valmistaa häiritseviä tekijöitä. Tarkkuus voittaa palautteen perustuvassa generoinnissa, eikä se ole lähelläkään.

Salaliittolainen kolme: kukaan ei mitä tilaa

Barnett et al. asettivat toiminnallisen totuuden yhteen lauseeseen: “RAG-järjestelmän validointi on mahdollista ainoastaan toiminnan aikana.” Et voi allekirjoittaa RAG-putkijohtoa esivalmistelussa, koska sen epäonnistumistilat ovat yhteinen ominaisuus aineistosi, kysymyksesi ja käyttäjiesi, eivätkä nämä pysy paikallaan.

Kuitenkin useimmat tuotantoputkijohto seuraavat lopputuloksen laatua parhaimmillaan, mikä sekoittaa kaksi edellä mainittua salaliittolaista yhteen selittämättömään lukuun. Standardijakoa kutsutaan joskus RAG-triadiksi, se erottaa kontekstin merkityksen (löysikö hakija oikean aineiston?), perustuvuuden (pysyykö vastaus kyseisessä aineistossa?) ja vastausmerkityksen (vastaaako se kysymyksen?). Kehykset, kuten RAGAS ja TruLens, toteuttavat sen. Olen rehellinen siinä, ettei kattavaa tutkimusta ole tehty siitä, kuinka vähän tuotantotiimejä ajaa näitä; mitä on olemassa, on käytännön tutkija, ja se kuvaa pääasiassa arviointia fiilistelyllä. Jos tiimilläsi ei ole kojussa, joka erottaa hakuvirheet uskollisuusvirheistä, jokainen hallusinaatio näyttää malliongelmalta, ja sinä jatkat ostamista mallin muotoisia korjauksia.

Mitä toimii oikeasti, järjestyksessä

Mittaa hakua erikseen generoinnista. Tämä on rumatön korjaus, jota jokainen ohittaa, ja minun mielestäni se on korkein prioriteetti tässä luettelossa, koska se muuttaa argumentin siitä, mikä malli ostetaan, diagnoosiin. Jos kontekstin merkitys on huono, mikään generoija ei voi pelastaa sinua. Jos perustuvuus on huono hyvällä kontekstilla, mikään hakija ei voi.

Rakenna tarkkuuspino. Anthropicin julkaisemat luvut ovat puhtain todiste siitä, miten hakukorjaus toimii: kontekstuaalinen palan sisäänrakennus leikkasi hakuvirheen 20 parhaan tuloksen joukosta 5,7%:sta 3,7%:iin, ja BM25-hybridihaku (perinteinen avain-sanahaun ohella vektorigraafista hakua) toi sen 2,9%:iin, ja uudelleenarvioija, toissijainen malli, joka arvioi ehdokaspalan todellista merkitystä, saavutti 1,9%, 67%:n kokonaisen vähennyksen. Unite.AI on kattavasti käsitellyt miksi kaksivaiheinen hakeminen on ylittänyt odotukset yksityiskohtaisesti.

Palkitse pidättyminen. OpenAI:n resepti on rangaista luottamusvirheitä enemmän kuin ilmoitettua epävarmuutta, ja voit toteuttaa paikallisen version tänään: pyydä ja arvioi “en tiedä” -vastauksia, ja lisää perustuvuustarkistus, johtopäätösmalli (NLI), joka vahvistaa, että jokainen generoitu väite on tuettu haetulla tekstillä ennen kuin vastaus toimitetaan. RAGTruth-työ osoitti, että pieni hienosäädetty ilmaisin voi vastata GPT-4-pohjaisen kysymyksen aiheuttamia tukahduttamattomia väitteitä.

Kirjoita kysymykset uudelleen ja suodata näyttöä. Lääketieteellisessä tarkastelussa kysymyksen uudelleenmuotoilu ja näytön suodatus palautti jopa 12 pistettä tosiasiallisuudesta. Halpaa, tylsää, tehokasta.

Harkitse agenssihakua lopuksi. Monivaiheinen hakeminen, joka ajattelee, mitä hakea seuraavaksi (esittely tässä), auttaa todella vaikeissa monihyppäilykysymyksissä, mutta se lisää viivettä, kustannuksia ja uusia epäonnistumistapoja. Se on huipentuma, ei perusta.

Malli oli vähiten rikkoontunut osa

Katsokaa taas avaamisesta. Jokainen askel siinä, sisäänrakennetun mallin vaihto, mallin päivittäminen, järjestelmän käskyn lisääminen, joka sanoo yhä epätoivoisemmin isoilla kirjaimilla: KÄYTÄ VAIN TARJOITETTUUNTA YHTENÄISÖÄ, käsitteli hallusinaatiota generoijan virheenä. Todisteet sanovat, että generoija teki vain sitä, mihin sen koulutus palkitsee, aineistojen kanssa, jotka hakija antoi sille, ilman mitään mittaria, joka olisi voinut sanoa, kumpi niistä epäonnistui.

RAG-putkijohtosi ei ole rikkoontunut. Se on kuuliainen. Se tekee täsmälleen sen, mihin sen kannustimet palkitsevat, ja kunnes mitäät hakua ja generointia erikseen ja teet “en tiedä” -vastauksesta pisteytyskategorian sijasta epäonnistumista, ne kannustimet sanovat: arvaile.

Gary on asiantuntija-kirjoittaja, jolla on yli 10 vuoden kokemus ohjelmistokehityksestä, web-kehityksestä ja sisällön strategiasta. Hän erikoistuu luomaan laadukkaita, mukaansatempaavia sisältöjä, jotka tuottavat muunnoksia ja rakentavat brändiloyaliteettia. Hänellä on intohimo kertomuksiin, jotka kiehtovat ja informoivat yleisöjä, ja hän etsii aina uusia keinoja käyttäjien mukaan tempaiseksi.