Liderzy opinii

Cztery Najdroższe Niepowodzenia Słabo Przetestowanego AI

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Kiedy firmy wdrażają AI bez rygorystycznej kontroli ludzkiej, podstawowo proszą niezależny system automatyczny o zweryfikowanie samego siebie.

Problem nie polega koniecznie na tym, że AI jest złe w testowaniu. AI jest doskonałe w wykonywaniu rzeczy, które zostały wcześniej zrobione, szczególnie podążając za zasadami, które wyraźnie ustalono. Ale niepowodzenia, które naprawdę szkodzą Twojej marce? Te żyją w przestrzeniach, gdzie ludzka ocena ma największe znaczenie. Halucynacja o polityce zwrotu. Odpowiedź niezgodna z marką na wrażliwą skargę. Bariera bezpieczeństwa, która nie wytrzymuje pod presją.

Z 70% klientów gotowych zmienić po jednej złej interakcji z AI, stawka jest wysoka. Jednak większość firm wprowadza AI zweryfikowane przez przestarzałe lub wyłącznie automatyczne narzędzia opracowane dla oprogramowania deterministycznego. Ten stos nigdy nie został zaprojektowany, aby złapać niepowodzenia, które naprawdę odpychają ludzi.

Przez zaangażowania Teslio dla zespołów przedsiębiorstw, cztery tryby niepowodzenia odpowiadają za większość widocznych dla klienta szkód. Żaden z nich nie zostanie złapany przez samodzielne testowanie.

1. Bariera Bezpieczeństwa, Która Nie Chroni

Klient pyta Twojego czata o odpowiednie pytanie w odpowiedni sposób. Bot oferuje im przedmiot za 10 dolarów, podczas gdy jego cena wynosi 1000 dolarów. Albo ujawnia informacje, których absolutnie nie powinien. Albo łamie podstawową regułę biznesową, ponieważ nikt nie przetestował warunków brzegowych.

Ryzyko jest proste. Szkody są natychmiastowe i publiczne.

Prawdziwy problem nie polega tylko na automatyzacji, choć jest to część tego. Bariera bezpieczeństwa nie jest standaryzowana, musi być dostosowana do Twojego konkretnego kontekstu biznesowego. I nawet gdy są przestrzegane najlepsze praktyki, bariera pozostaje podatna. Techniki takie jak “poetyckie ucieczki” pokazują nam, że dobrze zaprojektowane bariery mogą być manipulowane w sposób, którego ich twórcy nigdy nie przewidzieli. Pytanie, które firmy muszą zadać, to nie “czy nasza bariera spełnia standardy branżowe?”, ale raczej “w jaki nowy sposób można tę barierę manipulować?”

Wymaga to myślenia przeciwnego. Kreatywnych, wnikliwych ludzi, którzy rozumieją zarówno projekt bariery, jak i powierzchnię ataku. Testowanie granic, testowanie wytrzymałościowe, zadawanie skomplikowanych pytań. To jest różnica między barierą, która przechodzi testy zgodności, a barierą, która naprawdę trzyma.

2. Niepowodzenia Dokładności i Logiki Biznesowej Ukryte w Halucynacjach

Rzeczywistość jest taka, że AI halucynuje. To, czego się nauczyłem, to fakt, że gdy masz doświadczenie w określonej dziedzinie, od razu zauważasz halucynację. Przezroczysto ją widzisz.

Ale jest tutaj krytyczna wada w poleganiu wyłącznie na wewnętrznym zespole: mają punkty ślepe. Gdy znasz produkt od podszewki, wiesz dokładnie, jakie pytania zadać, aby uzyskać odpowiedź. Nie możesz znaleźć nieścisłości, jeśli nie szukasz ich. Wewnętrzne zespoły wiedzą, jak produkt ma działać, a nie jak naprawdę działa dla prawdziwych użytkowników z różnymi modelami mentalnymi, różnymi kontekstami i różnymi sposobami łamania Twoich założeń.

To jest miejsce, w którym nadzór osób, które podejdą do systemu świeżo, jest niezwykle ważny. Nie tylko walidują, czy AI robi to, co im powiedziano; ujawniają problemy, które mogą być interesujące dla różnych działów i podkreślają obszary rzeczywistych niepowodzeń.

Gdy firmy zaczynają budować na podstawie głównych dużych modeli językowych, gdy dodają swoje procesy i przepływy pracy na górze, wymagania testowe stają się jeszcze bardziej krytyczne.

3. Zaniedbania Użyteczności i Doświadczenia Użytkownika

Czy to czuje się prawidłowo? Czy to wygląda prawidłowo? Czy przetwarzanie płatności zajmuje trochę za długo? Czy odpowiedź ma odpowiedni ton dla zirytowanego klienta czy odpowiedni tempo dla użytkownika po raz pierwszy.

To są rodzaje pytań, na które automatyczne narzędzia nie mogą odpowiedzieć. I są to rodzaje pytań, które mają ogromne znaczenie dla klientów.

Istnieje fundamentalna różnica między przejściem testu a byciem naprawdę dobrym. Interakcja z AI może spełnić wszystkie wymagania w Twoich kryteriach akceptacji i nadal być postrzegana jako błędna przez użytkownika. Może być technicznie poprawna, ale organizacyjnie niezgrabna. Może dostarczyć dokładne informacje w niewłaściwym tempie lub tonie.

To jest miejsce, w którym człowiek w pętli jest niezwykle ważny. Potrzebujesz ludzi przeszkolonych do rozpoznawania, jak AI zawodzi, testujących w regionach, w których żyją Twoi klienci, z urządzeniami i metodami płatności, których naprawdę używają. Ktoś testujący na najnowszym iPhone w San Francisco nie ma takiego samego doświadczenia jak ktoś testujący na średnim Androidzie z słabym połączeniem danych w Dżakarcie. Bez różnorodności w tym, kto testuje i gdzie, otrzymujesz symulowane wyniki, które zawiodą w momencie, gdy Twój produkt spotka się z rzeczywistością.

Musisz mieć kogoś, kto naprawdę używa produktu, myśli o tym, co oznacza doświadczenie, i naprawdę sprzeciwia się, gdy coś nie czuje się prawidłowo.

4. Iluzja Zweryfikowanej Ekspertyzy

To jest najbardziej subtelne niepowodzenie i może najgroźniejsze. Gdy firmy wdrażają AI bez odpowiedniego testowania, często stawiają na to, że AI wchłonęło wystarczającą wiedzę, aby odpowiednio obsłużyć dziedzinę. Zakładają, że ponieważ AI może brzmieć pewnie co do czegoś, prawdopodobnie wie, o czym mówi.

Ale jest inna wymiara tego ryzyka. Większość ludzi korzystających z funkcji AI robi to samo założenie. Nie kwestionują wyników. Jeśli brzmi autorytatywnie i nie jest oczywiście błędne, ufają mu. Złe porady medyczne. Niepoprawne porady prawne. Wadliwe rekomendacje finansowe. Konsekwencje kumulują się, gdy użytkownicy zakładają, że AI jest poprawne i nie mają powodu, aby to kwestionować.

AI jest bardzo dobre w tym, co zostało zrobione. Nie jest dobre w tym, co powinno być zrobione w nowych sytuacjach. Każde przedsiębiorstwo ma nowe sytuacje. Każdy produkt ma przypadki brzegowe. Każda ścieżka klienta ma moment, w którym odpowiedź powinna być taka, której AI nie zostało przeszkolone, aby dać.

Przedefiniowanie Gotowości Do Wypuszczenia

Dojrzała strategia wypuszczenia AI wymaga przeniesienia się poza umysł automatyzacji.

  • Inżynieria: Ten zespół powinien posiadać integralność systemu, definiując, co oznacza niepowodzenie na poziomie modelu i infrastruktury, oraz gdzie bariery powinny siedzieć.
  • Produkt: Liderzy powinni posiadać granice decyzyjne, oceniając, które decyzje AI może podejmować samodzielnie, które wymagają zatwierdzenia przez człowieka, a które nie powinny być przez niego podejmowane.
  • Projekt i QA: Ci profesjonaliści powinni posiadać doświadczenie użytkownika, czy użytkownicy rozumieją, co AI robi, czy mogą rozpoznać, gdy jest błędne, i czy mają uzasadniony odwołanie, gdy tak jest.

Musimy zaakceptować, że chociaż AI może tworzyć niesamowite doświadczenia dla naszych klientów, nie może być swoim własnym sędzią i ławnikiem. Odpowiedzialność za jakość AI jest kwestią organizacyjną, rozproszoną w zespołach, zakotwiczoną w ludzkiej ekspertyzie i ugruntowaną w testowaniu świata rzeczywistego.

Darin Brown jest Dyrektorem ds. Produktu i Technologii (CPTO) w firmie Testlio, gdzie kieruje globalną strategią technologiczną i ewolucją produktu w celu poprawy jakości cyfrowej za pomocą testowania AI z udziałem człowieka. Z ponad 20-letnim doświadczeniem w skalowaniu platform SaaS dla przedsiębiorstw, wcześniej kierował strategią produktu dla grupy aplikacji Productivity Apps firmy Zoom po jej przejęciu przez Docket, które współzałożył, oraz pełnił role kierownicze jako CTO w firmie Angie's List i VP w firmie Salesforce.