Andersonin kulma

Jopa perus-AI voi nykyään kirjoittaa uutisia, jotka eivät erotu ihmisten kirjoittamista

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
AI-generated illustration: a stylized orthographic illustration depicting a woman seated at her home office desk reading a laptop, and a cut-away diagram depicting 'Schrodinger's news source' - a box with a robot writing an article, partitioned from a human writing an article. Each has a stylized journalist appearance. The idea being conveyed is that until you actually know who wrote the piece the woman is reading, it could have been a human or a robot. GPT-1.5

Uusi tutkimus osoittaa, että jopa pienet paikalliset AI-mallit voivat kirjoittaa uutisia, jotka ihmiset eivät voi erottaa aidoista journalismista, ja ne ovat yhtä hyviä kuin parhaat järjestelmät, joten lukijat eivät voi sanoa, kuka kirjoitti mitä.

 

Saksan ja Ranskan tutkimusyhteistyön mukaan ihmiset eivät voi sanoa, onko uutisartikkeli kirjoitettu AI:lla vai ihmisellä, vaikka se on kirjoitettu avoimen lähdekoodin malleilla, jotka voidaan ladata ja suorittaa suhteellisen tavallisilla kuluttajatason työpöytätietokoneilla.

Toisena osoituksena siitä, että pieni AI on nousussa, 1 054 osallistujan antamista 2 318 arvioinnista kerätyn aineiston mukaan ihmiset eivät voi tunnistaa artikkelin alkuperää luotettavasti, vaikka se olisi tuotettu melko vaatimattomilla malleilla, joissa on vain seitsemän miljardia parametriä, mukaan lukien Mistral ja Llama-versiot:

Keskimääräiset lähde- ja aitouden arvosanat testatuille LLM:ille. GPT-4o:n 200 miljardia parametriä eivät ole merkittävästi suurempia kuin pienempien mallien 7 miljardia parametriä. Tutkimuksessa testattiin Gemma 7B, Phi-3 Mini, LLaMA-2 13B, Mistral 7B, GPT-4o ja GPT-3.5.

Keskimääräiset lähde- ja aitouden arvosanat testatuille LLM:ille. GPT-4o:n 200 miljardia parametriä eivät ole merkittävästi suurempia kuin pienempien mallien 7 miljardia parametriä. Tutkimuksessa testattiin Gemma 7B, Phi-3 Mini, LLaMA-2 13B, Mistral 7B, GPT-4o ja GPT-3.5. Lähde

Tutkijat palaavat aiheeseen, jonka he tutkivat ensimmäisen kerran vuoden 2024 julkaisussa Blessing or curse? A survey on the Impact of Generative AI on Fake News. Itse tulokset ovat uusia tuloksia suuremmasta hankkeesta, josta ilmoitettiin alun perin tammikuussa, ja ne hyödyntävät tutkijoiden omaa JudgeGPT-verkkoyhteistyöalustaa.

Featherweight Power

Tutkimuksen Can Humans Tell? A Dual-Axis Study of Human Perception of LLM-Generated News metodologia tekee tärkeän eron “väärennettyjen uutisten” ja “AI-kirjoitetun uutisen” (koska väärennetty uutinen voidaan kirjoittaa ihmisellä tai AI:lla, ja nämä kaksi asiaa eivät välttämättä ole sama) välillä.

Kuitenkin ehkä mielenkiintoisin asia on tutkimuksen johtopäätös, että pienet mallit, kuten Mistral 7B ja Gemma 7B, voivat vastata aplombilla jättimäisen ChatGPT-mallin (4o) kaltaisia 200 miljardin parametrin malleja:

‘Avoin malli, jossa on vain 7 miljardia parametriä, tuottaa tekstiä, jota ei voida erottaa GPT-4o:n tuottamasta, mikä osoittaa, että kyky tuottaa ihmisten jaottamattomia tekstejä ei ole enää rajoitettu vain suurimpiin malleihin.’

Kuitenkin “AI-kirjoitettu uutinen” voi edustaa monia erilaisia ihmisen ja AI:n yhteistyön muotoja, alkaen oikoluvusta aina täydelliseen ponnistelun siirtymiseen, ja tutkimus ei selkeästi määrittele, millaista AI-sisältöä tuotettiin testeihin (vaikka se selittää menetelmän, jolla se tuotettiin – ks. alla).

Method

JudgeGPT-alustalla osallistujille esitettiin kunkin uutisfragmentin arvioimiseen kaksiakselinen kehys, jossa he antoivat kolme riippumattoman arviointia jatkuvalla 0-100 liukusäätimellä:

JudgeGPT-portaalin GUI, jossa arvioijat arvioivat materiaalia lähde-attribuutin, aitouden ja aiheen tuttuuden perusteella.

JudgeGPT-portaalin GUI, jossa arvioijat arvioivat materiaalia lähde-attribuutin, aitouden ja aiheen tuttuuden perusteella. Katso lähdeartikkeli paremman resoluution kuvan vuoksi.

Lähdearvio sai kiinni siitä, näyttikö jokin kohtaus konekirjoitetulta vai ihmisten kirjoittamalta; aitouden arvio, näyttikö se aidolta vai epäaidolta; ja aiheen tuttuus, kuinka hyvin lukija tunsi aiheen.

Jatkuvia skaaloja käytettiin Likert-asteikon sijaan, jotta voidaan tarkemmin havainnollistaa varmuuden asteita ja tukea tilastollista analyysiä, mukaan lukien Pearsonin korrelaatio ja klusterointi.

Konegeneroitu teksti tuotettiin tutkijoiden oman RogueGPT-kehyksen avulla, joka on JudgeGPT:n syöttöarkkitehtuuri. RogueGPT orkestroi kuuden suuren kielen mallin (LLM) osallistumisen: ChatGPT-4; ChatGPT-3.5; ChatGPT-4o; LLaMA-2 13B; Gemma 7B; ja Mistral 7B.

Henkilökohtaiset ohjaukset käytettiin tekstien tuottamiseen, ja AI-synteesit perustuivat oikeisiin uutisaiheisiin ja ne tarkistettiin ihmisten toimesta.

Toisaalta ihmisten kirjoittamat fragmentit otettiin “vakiintuneista uutisvälineistä” ja määrittelemättömistä “tietokannoista”.

Tutkijat huomauttavat:

‘Stimulus-aineisto on tietoisesti vinoutunut konealkuperän fragmenteihin (~98%), ja ihmisen alkuperän kohteet toimivat kalibrointivirheinä.

‘Tämä suunnitteluratkaisu heijastaa tutkimuksen painopistettä AI:n sisäisessä vaihtelussa (mallien välillä) eikä ihmisten ja koneiden vertailussa; osallistujat eivät tiedä peruslukumäärää, ja lähes-sattumanvarainen havainto (tulokset) pitävät paikkansa, kun ne analyysiin vain ihmisen alkuperäisistä kohdekohteista.’

Osallistujat antoivat ensin suostumuslupauksen ja täyttivät demograafisen kyselylomakkeen, joka kattoi ikä, koulutus, poliittinen suuntautuminen ja tuttuus AI:n kanssa, minkä jälkeen he arvioivat uutisfragmenttien järjestyksen.

Kunkin henkilön tarkasteltiin 5-87 kohdetta, keskiarvona 12, ja esitysjärjestys oli satunnainen, ja mallin määräpyynnöt tasapainotettiin osallistujien kesken, jotta vältetään harhaa. Alusta tallensi kolme liukusäätimen arviointia vastausajan ja nimettömän tunnisteen kanssa, mikä mahdollisti yksilöllisten arvioiden linkittämisen taustatekijöihin.

Tutkijat korostavat, että otos on vinoutunut koulutetun eurooppalaisen väestön suuntaan, 68 % on yliopistokoulutusta ja 74 % on Euroopassa – vinous, jonka tutkimus toteaa yleistettävyyden rajoituksena.

Tests

Testit on jaettu viiteen löytötyyppiin: erottaminen konegeneroituista ja ihmisten kirjoittamista teksteistä; vertailu eri LLM-mallien havaintojen välillä; tutkimus aihealueen asiantuntemuksen vaikutuksesta tarkkuuteen; osallistujien erilaisten vastaamistyylien tunnistaminen; ja seuranta siitä, miten tarkkuus muuttuu toistuvissa arvioinneissa johtuen uupumuksesta:

Yhteenveto viidestä keskeisestä tuloksesta 2 318 arvioinnista 1 054 osallistujalta, osoittaa, että ihmisten havainto AI-kirjoitetuista teksteistä säilyi sattuman tasolla kaikissa malleissa, että tarkkuus liittyi aihealueen asiantuntemukseen eikä poliittiseen suuntautumiseen, osallistujat muodostivat erilaisia luottamuksen malleja, ja suorituskyky heikkeni noin 30 arvioinnin jälkeen uupumisen vuoksi.

Yhteenveto viidestä keskeisestä tuloksesta 2 318 arvioinnista 1 054 osallistujalta, osoittaa, että ihmisten havainto AI-kirjoitetuista teksteistä säilyi sattuman tasolla kaikissa malleissa, että tarkkuus liittyi aihealueen asiantuntemukseen eikä poliittiseen suuntautumiseen, osallistujat muodostivat erilaisia luottamuksen malleja, ja suorituskyky heikkeni noin 30 arvioinnin jälkeen uupumisen vuoksi.

Testin mukaan ei ollut merkittävää eroa lähdearvosanoissa ehdotusten välillä, mikä osoittaa, että osallistujat eivät voi erottaa AI-kirjoitettuja tekstejä ihmisten kirjoittamista:

Lähde- ja aitouden arvosanojen jakaumat kone- ja ihmisen alkuperäisistä fragmenteistä osoittavat merkittävää päällekkäisyyttä, ilman merkittävää eroa ehdotusten välillä, ja tilastollinen testi osoittaa, että osallistujat eivät voi luotettavasti erottaa AI-kirjoitettuja tekstejä ihmisten kirjoittamista.

Lähde- ja aitouden arvosanojen jakaumat kone- ja ihmisen alkuperäisistä fragmenteistä osoittavat merkittävää päällekkäisyyttä, ilman merkittävää eroa ehdotusten välillä, ja tilastollinen testi osoittaa, että osallistujat eivät voi luotettavasti erottaa AI-kirjoitettuja tekstejä ihmisten kirjoittamista.

Toisessa suhteessa havaintojen epäonnistuminen ei vaihdellut mallikohtaisesti, koska kaikkien LLM-mallien tulokset olivat lähellä sattuman tasoa, ilman merkittäviä eroja niiden välillä. Jopa pienemmät avoimet mallit, kuten Mistral 7B ja Gemma 7B, arvioitiin samalla tavalla kuin GPT-4o, mikä osoittaa, että ihmisten jaottamattomat tekstit eivät välttämättä ole enää rajoitettu vain suurimpiin malleihin.

Kolmannessa suhteessa tarkkuus liittyi vahvemmin aihealueen asiantuntemukseen kuin poliittiseen suuntautumiseen, koska väärennettyjen uutisten tuttuus korreloi paremmin arvioinnin tarkkuuden kanssa, kun taas poliittiset näkemykset eivät osoittaneet merkittävää vaikutusta, mikä viittaa siihen, että oppimisperäiset analyysitaidot voivat olla tärkeämpiä kuin ideologia:

Tulokset kolmannesta tutkimussuunnasta: osallistujien taustatekijöiden ja arviointitarkkuuden välinen korrelaatio osoitti, että poliittinen suuntautuminen ei ollut merkittävä vaikutus lähde- tai aitouden arviointiin, vaan väärennettyjen uutisten tuttuus oli yhteydessä parempaan tarkkuuteen molemmilla akselilla.

Tulokset kolmannesta tutkimussuunnasta: osallistujien taustatekijöiden ja arviointitarkkuuden välinen korrelaatio osoitti, että poliittinen suuntautuminen ei ollut merkittävä vaikutus lähde- tai aitouden arviointiin, vaan väärennettyjen uutisten tuttuus oli yhteydessä parempaan tarkkuuteen molemmilla akselilla.

Neljännessä tuloksessa osallistujat muodostivat kaksi erilaista vastaamistyyliä, joita kutsutaan “epäilijöiksi” – jotka antoivat alhaisen luottamuksen kaikille sisällöille riippumatta alkuperästä – ja “uskojiksi” – jotka pitivät korkeampaa luottamuksen perustasoa.

Lopulta viidennen tavoitteen osalta jatkuvan arvioinnin analyysi osoitti, että osallistujat aluksi paransivat tehtävän suorittamista, ja tarkkuus parani noin 15-20 arvioinnin jälkeen, kun he sopeutuivat tehtävään:

Lähde- ja aitouden arvosanojen liukuvat keskiarvot osallistujien arviointien järjestyksessä osoittavat lyhyen alun parantumisen, kun käyttäjät sopeutuvat tehtävään ensimmäisten 15-20 kohteen aikana, seurattuna tasaisella laskulla molemmilla mittareilla noin 30 arvioinnin jälkeen. Arvosanat laskevat kohti oletusarvoja – malli, jota tutkimuksessa tulkitaan kognitiiviseksi uupumukseksi.

Lähde- ja aitouden arvosanojen liukuvat keskiarvot osallistujien arviointien järjestyksessä osoittavat lyhyen alun parantumisen, kun käyttäjät sopeutuvat tehtävään ensimmäisten 15-20 kohteen aikana, seurattuna tasaisella laskulla molemmilla mittareilla noin 30 arvioinnin jälkeen.

Tämä vaikutus oli kuitenkin lyhytaikainen, ja suorituskyky alkoi heiketä noin 30 kohteen jälkeen, ja osallistujat alkoivat yhä useammin merkitä sisältöjä väärennetyiksi – siirtymä, jota tulkitaan kognitiiviseksi uupumukseksi, ja joka osoittaa selvät rajat sille, kuinka kauan havaintopohjaiset lähestymistavat voivat pysyä tehokkaina käytännössä.

Tämä saattaa edustaa jossain määrin empiiristä näyttöä siitä, että uupuneina väärennetyn ja aidoista uutisista, AI-kirjoitetuista ja ihmisten kirjoittamista, ihmiset saattavat olettaa, että uutiset ovat AI:n tuottamia ja/tai väärennettyjä, “turvallisuuden” vuoksi. Ne, jotka pitävät tätä “laiskana” ja ajattelevat, että ihmiset pitäisi tehdä oma tutkimus väärennettyjen uutisten todentamiseksi, saattavat olla kiinnostuneita siitä, että tämä vain pahentaa ongelmaa.

Tutkijat ehdottavat, että havaintojen epäonnistuminen tuloksissa osoittaa, että asioiden siirtäminen salamaverkkoteknologioihin, kuten Adoben johtamaan C2PA-alusta, voi olla tarpeen. Muita mahdollisia ratkaisuja ovat tutkijoiden omat OriginLens-kehyksen ja toinen tutkijoiden mukana oleva CRED-1-projekti.

Tutkijat johtavat:

‘Voivatko ihmiset sanoa? Meidän kaksisuuntainen tutkimuksemme 2 318 arvioinnista kuudesta LLM-perheestä antaa selkeän empiirisen vastauksen: he eivät voi.

‘Konegeneroitu teksti on erottamaton ihmisten kirjoittamasta riippumatta mallin koosta tai perheestä, aihealueen asiantuntemus ennustaa havaintotarkkuutta vahvemmin kuin poliittinen suuntautuminen, osallistujat omaksuvat erilaisia luottamuksen malleja, ja kognitiivinen uupumus rajoittaa kestävää havaintoa.

‘Nämä tulokset tukevat siirtymistä käyttäjätasolla tapahtuvasta havainnosta järjestelmätasolla tapahtuviin vastatoimiin, mukaan lukien sisällön alkuperä, dynaamiset luottamuksen osoittimet ja rajoitettu rokotus.

Johtopäätös

Hämmästyttävä asia tässä tutkimuksessa on tutkijoiden aiempien projektien ja tutkimusten tukiverkosto, ja olisi varmasti mielenkiintoista tutkia esimerkkejä AI- ja ihmisten kirjoittamista teksteistä, jotka tuottivat nämä tulokset, jotta voimme ymmärtää paremmin tuotetun sisällön laatua.

Kuitenkin on mielenkiintoista kuulla, että avoimet, avoimen lähdekoodin mallit voivat kilpailla API-pohjaisiden jättimäisten, kuten ChatGPT-sarjan, kanssa – voiko tehtävä olla yksinkertaisesti liian helppo, ja 200 miljardin parametrin malli on ylilyöntiä? Tarvitsisimme tietää enemmän AI- ja ihmisten kirjoittamista lähdemateriaaleista, jotta voimme vastata tähän kysymykseen.

Sillä aikaa canirun.ai-sivuston mukaan Mistral 7B (joka oli suhteellisen samalla tasolla kuin ChatGPT-4o testeissä) ‘suorittaa hyvin’ NVIDIA RTX 3080:lla, jossa on 16 GB VRAM, ja ‘suorittaa kohtalaisesti’ 3060:lla, jossa on 6 GB VRAM – eivät kaikkein uusimmat tai parhaimmat näytönohjaimet. Joten kuka tahansa, joka haluaa kehittää oman menetelmänsä näytteen esittämiseen, voi osallistua näihin kokeisiin.

 

* Gemma 7B ei ole listattu sivustolla.

Julkaistu torstaina, 9. huhtikuuta 2026

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai