Ajatusjohtajat

Neljä kalleinta epäonnistumista huonosti testatulla tekoälyllä

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Kun yritykset käyttävät tekoälyä ilman tiukkaa ihmisten valvontaa, he pyytävät perustuu epädeterministiseen automaattiseen järjestelmään vahvistamaan itsensä.

Ongelma ei välttämättä ole se, että tekoäly on huono testaamisessa. Tekoäly on erinomainen tekemään asioita, jotka on tehty aiemmin, erityisesti seuraamalla sääntöjä, jotka olet nimenomaisesti asettanut. Mutta epäonnistumiset, jotka vahingoittavat todella brändiäsi? Ne elävät tiloissa, joissa ihmisten arvostelukyky on tärkeintä. Hallusinaatio palautumispolitiikasta. Epätyypillinen vastaus herkkään valituksiin. Turvallisuuden varmistus, joka ei pidä painetta vastaan.

Kun 70%: ia asiakkaista on valmis vaihtamaan palveluntarjoajaa yhden huonon tekoälykokemuksen jälkeen, panokset ovat korkeat. Kuitenkin useimmat yritykset toimittavat tekoälyä, jota vanhentuneet tai ainoastaan automaattiset työkalut ovat validoineet. Tämä pinorakenne ei ollut koskaan suunniteltu löytämään epäonnistumisia, jotka todella ajavat ihmiset pois.

Teslion yritysten kanssa tehtyjen asiakastilaisuuksien yhteydessä neljä epäonnistumistapaa kattaa suurimman osan asiakkaan näkökulmasta vahingoittavasta. Mikään niistä ei jää kiinni ainoastaan automaattisen testauksen avulla.

1. Turvallisuuden ja tietoturvan varmistukset, jotka eivät todella suojaa

Asiakas kysyy chatbotilta oikean kysymyksen oikealla tavalla. Botti tarjoaa heille 1 000 euron tuotteen 10 eurolla. Tai se paljastaa tietoa, jonka se ehdottomasti ei pitäisi paljastaa. Tai se rikkoaa perustavaa liiketoimintasääntöä, koska kukaan ei ole testannut reunaehdoja.

Riskejä on helppo ymmärtää. Vahinko on välitön ja vahinko on julkista.

Ongelma ei ole ainoastaan automaatio, vaikka se on osa siitä. Varmistukset eivät ole standardoituja, ne on sovitettava yrityksesi tiettyyn liiketoimintaympäristöön. Ja vaikka parhaimmat käytännöt noudatetaan, varmistukset ovat haavoittuvia. Tekniikat kuten “runoilijan murto” osoittavat, että hyvää tarkoittavat varmistukset voidaan manipuloida tavoilla, joita niiden luojat eivät koskaan odottaneet. Yritysten on kysyttävä itseltään ei “noudattaako varmistuksesi toimialan standardeja?” vaan “miten tämä malli voidaan manipuloida uusilla tavoilla?”

Tämä vaatii vastakkaisia ajatuksia. Luovia, tutkivia ihmisiä, jotka ymmärtävät sekä varmistuksen suunnittelua että hyökkäysaluetta. Testaaminen reunoilla, kuormittaminen, monimutkaiset kysymykset. Se on ero varmistuksen välillä, joka läpäisee vaatimukset ja varmistuksen, joka todella pitää.

2. Tarkin ja liiketoimintalogiikan epäonnistumiset, jotka piilevät hallusinaatioissa

Todellisuus on, että tekoäly hallucinoi. Mitä olen oppinut, on, että kun sinulla on alaan liittyvää asiantuntemusta, huomaat hallusinaation heti. Näet suoraan läpi.

Mutta tässä on kriittinen virhe, joka liittyy ainoastaan sisäiseen tiimiin: heillä on sokeat pisteet. Kun tiedät tuotteen täydellisesti, tiedät tarkalleen, mitä kysymyksiä kysyä, jotta saat oikean vastauksen. Et voi löytää epätarkkuuksia, jos et etsi niitä. Sisäiset tiimit tietävät, miten tuote on tarkoitus toimia, eivät miten se tosiasiallisesti toimii todellisille käyttäjille, joilla on erilaiset miellekkyydet, erilaiset kontekstit ja erilaiset tavat rikkoa oletuksiasi.

Siihen tulee apuun valvonta sellaisilta ihmisiltä, jotka lähestyvät järjestelmää uudelleen. He eivät ainoastaan vahvista, että tekoäly tekee sen, mitä olet sanonut sen tekevän; he paljastavat ongelmia, jotka voivat olla kiinnostavia eri osastoille, ja korostavat alueita, joilla todelliset epäonnistumiset tapahtuvat.

Kun yritykset alkavat rakentaa suurten kielimallien päälle, kun he lisäävät omat prosessinsa ja työnkulunsa päälle, testausvaatimukset tulevat entistä kriittisimmiksi.

3. Käytettävyyden ja käyttökokemuksen laiminlyönti

Tuntuuko se oikealta? Näyttääkö se oikealta? Kestääkö maksujen prosessointi vähän liian kauan? Onko vastaus oikean sävyn omaava asiakkaalle, joka on pettynyt, tai oikean tahdin omaava uudelle käyttäjälle.

Nämä ovat sellaisia kysymyksiä, joita automaattiset työkalut eivät voi vastata. Ja ne ovat sellaisia kysymyksiä, jotka ovat asiakkaille erittäin tärkeitä.

On perustava ero siinä, mitä tarkoittaa läpäistä testisarja ja olla todella hyvä. Tekoälykokemus voidaan merkitä jokaisella ruudussa hyväksymiskriteereissä ja silti voidaan havaita vääräksi käyttäjälle. Se voidaan olla teknisesti oikein, mutta organisaatiotasolla kömpelö. Se voidaan toimittaa tarkin tiedon oikeassa tahdissa tai sävyssä.

Tässä on Ihminen silmässä -periaate välttämätön. Tarvitset ihmisiä, jotka on koulutettu tunnistamaan, miten tekoäly epäonnistuu, testaamaan alueilla, joissa asiakkaasi asuvat, laitteilla ja maksutavoilla, joita he todella käyttävät. Joku, joka testaa huipputasoisella iPhone:lla San Franciscossa, ei ole samaa kokemusta kuin joku, joka testaa keskitasoisella Androidilla epävakaaan verkkoyhteyden kanssa Jakartassa. Ilman monimuotoisuutta siinä, kuka testaa ja missä, saat simuloituja tuloksia, jotka epäonnistuvat heti, kun tuotteesi kohtaa todellisuuden.

Sinun on oltava joku, joka todella käyttää tuotetta, ajattelee, mitä kokemus merkitsee, ja vastustaa, kun jotain ei tuntu oikealta.

4. Illuusio vahvistetusta asiantuntijuudesta

Tämä on hienoin epäonnistuminen ja ehkä vaarallisin. Kun yritykset käyttävät tekoälyä ilman kunnollista testausta, he usein panostavat siihen, että tekoäly on omaksunut riittävästi tietoa toimia alan asiantuntijana. He olettavat, että koska tekoäly voi kuulostaa varmalta jostakin asiasta, se todennäköisesti tietää, mitä puhuu.

Mutta on toinen ulottuvuus tähän riskiin. Useimmat ihmiset, jotka käyttävät tekoälyominaisuuksia, tekevät saman oletuksen. He eivät kyseenalaista tulostetta. Jos se kuulostaa viralliselta eikä ole ilmiselvästi väärin, he luottavat siihen. Huono lääkintäneuvonta. Virheellinen oikeudellinen ohjeistus. Virheelliset rahoitusohjeet. Seuraukset kasvavat, kun käyttäjät olettavat, että tekoäly on oikein eivätkä ole mitään syytä epäillä sitä.

Tekoäly on erittäin hyvä tietämään, mitä on tehty. Se ei ole hyvä tietämään, mitä pitäisi tehdä uusissa tilanteissa. Jokaisella liiketoiminnalla on uusia tilanteita. Jokaisella tuotteella on reunaehdot. Jokaisella asiakkaan polulla on hetki, jossa oikea vastaus on se, jonka tekoälylle ei ole koulutettu antamaan.

Uudelleenmäärittely julkaistavuutta

Kypsä tekoälyjulkaisustrategia vaatii siirtymistä automaatio-ajattelun yli. Se vaatii rakenteellisen kehyksen, jossa on ihmisten asiantuntemus mukana.

  • Insinöörit: Tämän tiimin tulisi omistaa järjestelmän eheys, määritellä, miltä epäonnistuminen näyttää mallin ja infrastruktuurin tasolla, ja mistä varmistukset tarvitaan.
  • Tuote: Johtajien tulisi omistaa päätösrajat, arvioida, mitkä päätökset tekoäly saa tehdä itsenäisesti, mitkä vaativat ihmisen hyväksyntää ja mitkä se ei saa koskaan tehdä.
  • Suunnittelu ja laatu: Nämä ammattilaiset tulisi omistaa käyttökokemuksen, voivatko käyttäjät ymmärtää, mitä tekoäly tekee, voivatko he tunnistaa, kun se on väärin, ja onko heillä merkityksellistä muutosta, kun se on väärin.

Meidän on hyväksyttävä, että vaikka tekoäly voi luoda uskomattomia kokemuksia asiakkaillemme, se ei voi olla oma tuomari ja valamiehistö. Tekoälylaadun vastuu on organisaatiotasolla, jakautunut tiimien kesken, juurtunut ihmisten asiantuntemukseen ja perustuu todelliseen testaukseen.

Darin Brown on Chief Product and Technology Officer (CPTO) Testliossa, jossa hän johtaa globaalia teknologiategemiska strategiaa ja tuotteen kehittymistä digitaalisen laadun edistämiseksi ihmisen ja AI:n yhteistyön kautta. Yli 20 vuoden kokemuksella yritys-SaaS-alustoja skaalaamisesta hän on aiemmin johtanut tuotestrategiaa Zoomin Productivity Apps -ryhmässä sen jälkeen, kun se osti Docketin, jonka hän perusti, ja hän on toiminut johtotehtävissä Angie's Listin CTO:na ja Saleforcen VP:na.