AI-mallit ja alustat

Miksi tekoälychatbotit ovat usein sycophantteja?

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Kuvitteletko, että tekoälychatbotit ovat liian halukkaita samaan suostumaan sinun kanssa? Riippumatta siitä, onko kyse siitä, että se kertoo, että epäilyksellesi idea on “loistava” tai tukkii sinua asiassa, joka voi olla väärä, tämä käyttäytyminen on herättänyt maailmanlaajuista huomiota.

Äskettäin OpenAI sai huomiota, kun käyttäjät huomasivat, että ChatGPT toimi liian paljon kuten kiusallinen ihminen. Päivitys sen malliin 4o teki botista niin kohteliasen ja vahvistavan, että se oli valmis sanomaan mitä tahansa pitääkseen sinut tyytyväisenä, vaikka se oli vääristynyt.

Miksi nämä järjestelmät taipuvat kohteliaisuuteen ja mikä saa ne toistamaan mielipiteesi? Nämä kysymykset ovat tärkeitä ymmärtääksesi, miten voit käyttää generatiivista tekoälyä turvallisemmin ja nautinnollisemmin.

ChatGPT-päivitys, joka meni liian pitkälle

Alkuvuonna 2025 ChatGPT-käyttäjät huomasivat jotain outoa suuressa kielen mallissa (LLM). Se oli aina ollut ystävällinen, mutta nyt se oli liian miellyttävä. Se alkoi suostua melkein kaikkeen, riippumatta siitä, kuinka outo tai väärä väittämä oli. Voit sanoa, että et ole samaa mieltä jostain, ja se vastasi samalla mielipiteellä.

Tämä muutos tapahtui järjestelmäpäivityksen jälkeen, jonka tarkoituksena oli tehdä ChatGPT:stä avuliaampi ja keskustelumaisempi. Kuitenkin yrityksessään parantaa käyttäjän tyytyväisyyttä malli alkoi painottaa liian paljon noudattamista. Sen sijaan, että se olisi tarjonnut tasapuolisia tai tosiasiallisia vastauksia, se taipui vahvistamiseen.

Kun käyttäjät alkoivat jakaa kokemuksiaan liian sycophantista vastauksista verkossa, takaisku syttyi nopeasti. Tekoälykommentaattorit pitivät sitä mallin virheenä, ja OpenAI vastasi peruvalla osia päivityksestä korjataksesi ongelman.

Julkisessa viestissä yhtiö tunnusti GPT-4o:n olevan sycophantinen ja luvattiin tehdä säätöjä vähentääksesi käyttäytymistä. Se oli muistutus siitä, että hyvät aikomukset tekoälysuunnittelussa voivat joskus mennä pieleen, ja että käyttäjät huomaavat nopeasti, kun se alkaa olla epäaidosti.

Miksi tekoälychatbotit suostuvat käyttäjiin?

Sycophantia on jotain, mitä tutkijat ovat havainneet monissa tekoälyavustajissa. ArXiv:ssä julkaistu tutkimus osoitti, että sycophantia on laaja käyttäytymismalli. Analyysi paljasti, että tekoälymallit viidestä huipputason toimittajasta suostuvat käyttäjiin johdonmukaisesti, vaikka ne johtavat väärään vastaukseen. Nämä järjestelmät taipuvat myöntämään virheensä, kun kysyt niiltä, mikä johtaa vääristyneisiin palautteisiin ja jäljitellyistä virheistä.

Nämä chatbotit on koulutettu suostumaan sinun kanssa, vaikka olet väärässä. Miksi tämä tapahtuu? Lyhyt vastaus on, että kehittäjät tekivät tekoälystä avuliaan. Kuitenkin tämä avuliaisuus perustuu koulutukseen, joka priorisoi positiivista käyttäjäpalautetta. Vahvistusoppimisen avulla ihmisille annetaan palautetta (RLHF), mallit oppivat maksimoimaan vastauksia, jotka ihmiset pitävät tyytyväisinä. Ongelma on, että tyytyväisyys ei aina tarkoita tarkkuutta.

Kun tekoälymalli aistii käyttäjän etsivän tietynlaista vastausta, se taipuu yleensä suostumaan. Se voi tarkoittaa, että se vahvistaa mielipiteesi tai tukee väärää väittämää pitääkseen keskustelun sujuvana.

On myös peilausvaikutus. Tekoälymallit heijastavat syötteen saamansa ilmeen, rakenteen ja logiikan. Jos kuulostat varmalta, robotti on myös todennäköisemmin varma. Se ei kuitenkaan tarkoita, että malli ajattelee, että olet oikeassa. Se tekee vain työtään pitääkseen asiat ystävällisinä ja näyttääkseen avuliaalta.

Vaikka se saattaa tuntua siltä, että chatbotti on tukijärjestelmä, se voi olla heijastus siitä, miten se on koulutettu miellyttämään sen sijaan, että se haastaisi.

Onkeloitekoälyn ongelmat

Vaikka se saattaa tuntua harmittomalta, kun chatbotti suostuu kaikkeen, mitä sanot, sycophantinen tekoälykäyttäytyminen on haitallista, erityisesti kun nämä järjestelmät tulevat yleisemmiksi.

Väärät tiedot saavat läpipääsyn

Tarkkuus on yksi suurimmista ongelmista. Kun nämä älykkäät robotit vahvistavat väärää tai vääristynyttä väittämää, ne vaarantavat väärien ymmärrysten vahvistamisen sen sijaan, että ne korjaisivat niitä. Tämä muodostuu erityisen vaaralliseksi, kun haetaan ohjeita vakavista aiheista, kuten terveydestä, taloudesta tai ajankohtaisista tapahtumista. Jos LLM priorisoi suostumista rehellisyyden sijaan, ihmiset voivat poistua väärillä tiedoilla ja levittää niitä.

Jättää vähän tilaa kriittiselle ajattelulle

Tekoälyn viehätys on sen potentiaali toimia ajattelukumppanina — haastamaan oletuksiasi tai auttamaan sinua oppimaan uutta. Kuitenkin, kun chatbotti aina suostuu, sinulla on vähän tilaa ajatella. Kun se heijastaa ideoitasi ajan myötä, se voi tylsistyttää kriittistä ajattelua sen sijaan, että se teroittaisi sitä.

Huomioi ihmishenkiä

Sycophantinen käyttäytyminen on enemmän kuin häiriö — se on potentiaalisesti vaarallista. Jos pyydät tekoälyavustajalta lääketieteellistä neuvontaa ja se vastaa lohduttavalla suostumisella sen sijaan, että se antaisi näyttöön perustuvaa ohjeistusta, seurauksena voi olla vakavia vahinkoja.

Esimerkiksi, jos navigoit konsultointialustalle käyttämään tekoälyllistä lääketieteellistä robottia. Kun kuvailet oireita ja epäilet, mitä tapahtuu, robotti voi vahvistaa itsediagnoosisi tai alentaa tilasi. Tämä voi johtaa väärään diagnoosiin tai viivästettyyn hoitoon, mikä voi johtaa vakaviin seuraamuksiin.

Lisää käyttäjiä ja avoimuus tekee siitä vaikeamman hallita

Kun nämä alustat tulevat osaksi päivittäistä elämää, näiden riskien ulottuvuus jatkuu kasvamista. ChatGPT palvelee jo 1 miljardia käyttäjää joka viikko, joten vääristymät ja liian suostuvat mallit voivat levitä laajaan yleisöön.

Lisäksi tämä huolenaihe kasvaa, kun otetaan huomioon, miten nopeasti tekoäly on muuttunut helpoksi käyttää avoimien alustojen kautta. Esimerkiksi DeepSeek AI sallii kenen tahansa mukauttaa ja kehittää sen LLM: ää ilmaiseksi.

Vaikka avoimen lähdekoodin innovaatio on jännittävää, se tarkoittaa myös vähemmän valvontaa siitä, miten nämä järjestelmät käyttäytyvät kehittäjien käsissä, joilla ei ole turvallisuutta. Ilman asianmukaista valvontaa ihmiset riskivät nähdä sycophantisen käyttäytymisen vahvistuvan tapoja, jotka ovat vaikeita jäljittää, vielä vähemmän korjata.

Miten OpenAI-kehittäjät yrittävät korjata sen

Kun OpenAI perui päivityksen, joka teki ChatGPT:stä ihmisten miellyttäjän, se luvattiin korjata. Miten se on ratkaisemassa tätä ongelmaa useilla tärkeillä tavoilla:

  • Korjaamalla ydinkoulutusta ja järjestelmän ohjeita: Kehittäjät ovat sopeuttamassa, miten he kouluttavat ja ohjaavat mallia selkeämmillä ohjeilla, jotka työntävät sitä rehellisyyden puolelle ja pois automaattisesta suostumisesta.
  • Lisäämällä vahvempia turvallisuusvarusteita rehellisyydelle ja avoimuudelle: OpenAI on lisäämässä enemmän järjestelmätasoisia suojauskeinoja varmistaakseen, että chatbotti pitäytyy tosiasiallisista ja luotettavista tietoista.
  • Laajentamalla tutkimus- ja arviointiponnisteluita: Yhtiö on syventämässä, mitä aiheuttaa tämän käyttäytymisen ja miten estää sitä tulevissa malleissa.
  • Ottamalla käyttäjiä mukaan prosessiin aikaisemmin: Se luo enemmän mahdollisuuksia ihmisille testata malleja ja antaa palautetta ennen päivitysten julkaisua, mikä auttaa havaitsemaan ongelmat, kuten sycophantian, aikaisemmin.

Miten käyttäjät voivat välttää sycophantista tekoälyä

Kun kehittäjät työskentelevät taustalla mallien uudelleenkoulutuksessa ja hienosäätössä, voit myös muotoilla, miten chatbotit vastaavat. Joitain yksinkertaisia, mutta tehokkaita keinoja tasapuolisempien vuorovaikutusten edistämiseksi ovat:

  • Käyttämällä selkeitä ja puolueettomia ohjeita: Sen sijaan, että muotoilet syötteen tavalla, joka anoo vahvistusta, kokeile avoimempia kysymyksiä, jotka tekevät siitä tuntuisen vähemmän pakotetuksi suostumaan.
  • Pyytämällä useita näkökulmia: Kokeile ohjeita, jotka pyytävät väittämän molemmat puolet. Tämä kertoo LLM:lle, että etsit tasapuolisuutta sen sijaan, että etsisit vahvistusta.
  • Haastamalla vastausta: Jos jokin kuulostaa liian imartelevasti tai yksioikoisesti, seuraa sitä pyytämällä faktantarkastuksia tai vastaväitteitä. Tämä voi työntää mallia kohti monimutkaisempia vastauksia.
  • Käyttämällä peukku ylös tai peukku alas -painikkeita: Palautteen antaminen on avainasemassa. Klikkaamalla peukku alas liian ystävällisistä vastauksista auttaa kehittäjiä merkintään ja säätämään näitä malleja.
  • Määrittämällä mukautettuja ohjeita: ChatGPT sallii nyt käyttäjille henkilökohtaisen mukauttamisen, miten se vastaa. Voit sopeuttaa, miten virallinen tai epävirallinen sävy pitäisi olla. Voit jopa pyytää sitä olemaan enemmän objektiivinen, suora tai epäileväinen. Jos menee Asetukset > Mukautetut ohjeet, voit kertoa mallille, millainen persoonallisuus tai lähestymistapa sinä haluat.

Antamalla totuuden yli peukun

Sycophantinen tekoäly voi olla ongelmallista, mutta hyviä uutisia on, että se on ratkaistavissa. Kehittäjät ovat ottamassa askelia ohjata nämä mallit kohti sopivampaa käyttäytymistä. Jos olet huomannut, että chatbotti yrittää miellyttää sinua liikaa, kokeile muotoilevat sitä älykkäämmäksi avustajaksi, johon voit luottaa.

Zac Amos on teknologiakirjoittaja, joka keskittyy tekoälyyn. Hän on myös ReHack:in toimittaja, jossa voit lukea enemmän hänen työstään.