Myslitelé

Čtyři nejdražší selhání špatně otestovaného AI

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Když společnosti nasazují AI bez přísného lidského dohledu, vlastně se ptají nedeterministického automatizovaného systému, aby se sám ověřil.

Problém není nutně v tom, že AI je špatná v testování. AI je excelente v provádění věcí, které byly již dříve provedeny, zejména při dodržování pravidel, která jste výslovně stanovili. Ale selhání, která skutečně poškozují vaši značku, žijí v prostorech, kde lidský úsudek má největší význam. Halucinace o zásadách vrácení peněz. Nevhodná odpověď na citlivou stížnost. Bezpečnostní zábrana, která nevydrží pod tlakem.

S 70% zákazníků ochotných přejít k jinému produktu po jediné špatné interakci s AI, jsou sázky vysoké. Přesto většina společností nasazuje AI ověřenou zastaralými nebo pouze automatizovanými nástroji, které byly vyvinuty pro deterministický software. Tento software nebyl nikdy navržen tak, aby chyty selhání, která skutečně odrazují lidi.

Na základě zkušeností Teslia s nasazením AI pro podnikové týmy existují čtyři typy selhání, které jsou odpovědné za většinu viditelného poškození. Žádný z nich není chytitelný pouze automatizovaným testováním.

1. Bezpečnostní a bezpečnostní zábrany, které vlastně nezajišťují bezpečnost

Zákazník položí vašemu chatbotu správnou otázku správným způsobem. Chatbot nabízí $1 000 produkt za $10. Nebo odhalí informace, které by neměl. Nebo poruší základní obchodní pravidlo, protože nikdo netestoval hranice.

Riziko je přímočaré. Poškození je okamžité a veřejné.

Skutečný problém není pouze automatizace, i když to je část problému. Zábrany nejsou standardizovány, musí být přizpůsobeny vašemu konkrétnímu obchodnímu kontextu. A i když jsou dodržovány nejlepší postupy, zábrany zůstávají zranitelné. Techniky, jako je “poetic jailbreaks“, ukazují, že dobře míněné zábrany mohou být manipulovány způsoby, které jejich tvůrci nikdy neočekávali. Otázka, kterou si společnosti musí položit, není “naše zábrana dodržuje průmyslové standardy?”, ale spíše “jaké nové způsoby může být tento model manipulován?”

To vyžaduje adversativní myšlení. Kreativní, zkoumající lidé, kteří rozumí jak návrhu zábrany, tak útočnému povrchu. Testování hranic, stresové testování, pokládání složitých otázek. Je to rozdíl mezi zábranou, která prochází kontrolou, a zábranou, která skutečně drží.

2. Nesprávnosti a obchodní logické selhání skryté v halucinacích

Realita je taková, že AI halucinuje. Co jsem se naučil, je, že když máte odborné znalosti v oblasti, okamžitě si všimnete halucinace. Prohlédnete skrz ni.

Ale zde je kritický nedostatek spoléhání se pouze na vnitřní tým: mají slepá místa. Když znáte produkt zevnitř, víte přesně, jaké otázky položit, aby jste dostali správnou odpověď. Nemůžete najít nesprávnosti, pokud je nehledáte. Vnitřní týmy znají, jak má produkt fungovat, ne jak skutečně funguje pro skutečné uživatele s odlišnými mentálními modely, kontexty a způsoby, jak porušit vaše předpoklady.

To je místo, kde přichází doba dohledu od lidí, kteří se na systém dívají čerstvě. Oni neověřují pouze, zda AI dělá to, co jste mu řekli; ale také odhalují problémy, které by mohly být zajímavé pro různé oddělení a zdůrazňují oblasti skutečného selhání.

Když společnosti začínají stavět na velkých jazycových modelech, když přidávají své vlastní procesy a pracovní postupy, požadavky na testování se stávají ještě kritičtějšími.

3. Přehlédnutí uživatelského rozhraní a zkušeností

Cítí se správně? Vypadá správně? Trvá zpracování plateb trochu příliš dlouho? Nese odpověď správný tón pro frustrovaného zákazníka nebo správný rytmus pro nového uživatele.

Tyto jsou otázky, které automatizované nástroje nemohou zodpovědět. A jsou to otázky, které mají enormní význam pro zákazníky.

Existuje fundamentální rozdíl mezi projitím testovací sady a skutečnou kvalitou. Interakce s AI může projít každým bodem v akceptačních kritériích a přesto být vnímána jako špatná uživatelem. Může být technicky správná, ale organizačně neohrabaná. Může dodat přesné informace ve špatném rytmu nebo tónu.

To je místo, kde je lidský faktor nezbytný. Potřebujete lidi, kteří jsou školeni k rozpoznání, jak AI selhává, testují v oblastech, kde žijí vaši zákazníci, s zařízeními a platebními metodami, které skutečně používají. Někdo, kdo testuje na špičkovém iPhone v San Francisku, nemá stejnou zkušenost jako někdo, kdo testuje na středním Androidu se slabým internetovým připojením v Jakartě. Bez rozmanitosti v testování a umístění získáte simulované výsledky, které selžou okamžitě, jakmile váš produkt potká realitu.

Musíte mít někoho, kdo skutečně používá produkt, skutečně myslí o tom, co zkušenost znamená, skutečně zpochybňuje, když něco není správné.

4. Iluze ověřené odbornosti

To je nejzákeřnější selhání, a možná nejnebezpečnější. Když společnosti nasazují AI bez řádného testování, často sázejí na to, že AI absorbovalo dostatek znalostí, aby správně zvládlo danou oblast. Předpokládají, že protože AI může znít sebevědomě o něčem, pravděpodobně ví, o čem mluví.

Ale existuje další rozměr tohoto rizika. Většina lidí, kteří používají funkce AI, dělá stejné předpoklady. Nezpochybňují výstup. Pokud zní autoritativně a není zjevně špatný, důvěřují mu. Špatné lékařské rady. Nesprávné právní rady. Chybná finanční doporučení. Důsledky se sčítají, když uživatelé předpokládají, že AI je správná, a nemají žádný důvod pochybovat o ní.

AI je velmi dobrá v tom, aby věděla, co bylo již dříve provedeno. Není dobrá v tom, aby věděla, co by se mělo udělat v nových situacích. Každý podnik má nové situace. Každý produkt má hraniční případy. Každá zákaznická cesta má okamžik, kdy správná odpověď je ta, kterou AI nebylo trénováno dát.

Předefinování připravenosti k vydání

Zralá strategie vydání AI vyžaduje přesunutí za hranice pouze automatizovaného myšlení. Zahrnuje budování strukturovaného rámce lidské odbornosti.

  • Inženýrství: Tento tým by měl vlastnit integritu systému, definovat, co vypadá selhání na úrovni modelu a infrastruktury, a kde zábrany potřebují sedět.
  • Produkt: Vedoucí by měli vlastnit rozhodovací hranice, posuzovat, welche rozhodnutí AI může učinit autonomně, které vyžadují lidské schválení, a které by neměly být dotčeny vůbec.
  • Design a QA: Ti by měli vlastnit uživatelskou zkušenost, zda uživatelé rozumí, co AI dělá, zda mohou rozpoznat, kdy je špatná, a zda mají smysluplné opravné prostředky, když je špatná.

Musíme přijmout, že zatímco AI může vytvářet úžasné zkušenosti pro naše zákazníky, nemůže být sama svým soudcem a porotou. Odpovědnost za kvalitu AI je organizační, rozložená napříč týmy, ukotvená v lidské odbornosti a zakořeněná v reálném testování.

Darin Brown je Chief Product and Technology Officer (CPTO) ve společnosti Testlio, kde řídí globální technologickou strategii a vývoj produktů za účelem zlepšení digitální kvality prostřednictvím testování AI s lidskou účastí. S více než 20 lety zkušeností se škálováním podnikových platforem SaaS dříve vedl produktovou strategii pro skupinu Produktivity Apps společnosti Zoom po jejím převzetí společnosti Docket, kterou spoluzaložil, a zastával vedoucí role jako CTO společnosti Angie's List a VP ve společnosti Salesforce.