Liderzy opinii

Dlaczego jakość danych decyduje o powodzeniu lub niepowodzeniu sztucznej inteligencji w przedsiębiorstwach

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google

Od czasu debiutu ChatGPT przez OpenAI pod koniec 2022 roku kaÅžda firma prÃģbuje przyspieszyć rozwÃģj sztucznej inteligencji. DuÅžy producenci sprzętu, tacy jak Nvidia, sprzedają więcej kart graficznych niÅž kiedykolwiek wcześniej, podczas gdy duzi twÃģrcy modeli, tacy jak OpenAI i Anthropic, nadal budują coraz większe modele.

Jednak nawet z najbardziej zaawansowanymi modelami i największymi budÅžetami wiele projektÃģw sztucznej inteligencji nadal zawodzi. Zaobserwowaliśmy to we wszystkich branÅžach, od opieki zdrowotnej po transport i finanse. PowÃģd nie jest odległy: sztuczna inteligencja jest tylko tak dobra, jak dane, na ktÃģrych została wyszkolona i ktÃģre otrzymuje w czasie rzeczywistym. Kiedy te dane są słabo oznaczone, przestarzałe lub niekompletne, Åžaden model nie moÅže dostarczyć spÃģjnych ani godnych zaufania wynikÃģw.

To jest duÅžy problem, z ktÃģrym borykają się dzisiaj wiele firm. Inwestują duÅžo w narzędzia sztucznej inteligencji, podczas gdy ich systemy danych pozostają rozproszone i niewiarygodne. Rezultatem jest iluzja postępu. Podczas gdy modele dostarczają imponujące odpowiedzi, wnioski są często oparte na słabych podstawach. Prawdzićą barierą dla sukcesu sztucznej inteligencji nie jest wydajność modelu. Jest to jakość danych.

Co to jest dobra jakość danych

Dobra jakość danych nie oznacza tylko dokładności. Oznacza informacje, ktÃģre są aktualne, kompletne i istotne dla problemu, ktÃģry jest rozwiązywany. WyobraÅš sobie klienta, ktÃģry prÃģbuje anulować zamÃģwienie na stronie internetowej. System musi sprawdzić szczegÃģły zamÃģwienia, status dostawy i rekord płatności. Jeśli ktÃģrekolwiek z tych punktÃģw danych znajdują się w rÃģÅžnych systemach, ktÃģre nie komunikują się ze sobą, asystent sztucznej inteligencji nie będzie w stanie dostarczyć przydatnej odpowiedzi.

Dobra jakość danych łączy te punkty natychmiast. Pozwala sztucznej inteligencji zobaczyć pełny obraz, a nie tylko fragmenty. Słaba jakość danych zmusza model do zgadywania. A kiedy sztuczna inteligencja zaczyna zgadywać, popełnia błędy, ktÃģre kosztują pieniądze i niszczą zaufanie. Ostatnie przykłady pokazują, jak niebezpieczne mogą być takie załoÅženia.

Chatbot biznesowy Nowego Jorku udzielał nielegalnych rad, poniewaÅž korzystał ze starej lub niekompletnej informacji prawnej. Bot obsługi klienta Air Canada składał fałszywe roszczenia o zwrot pieniędzy, poniewaÅž nie miał kontekstu z polityki firmy. Nawet duÅže systemy rekrutacyjne niesłusznie odrzucały kandydatÃģw z powodu tendencyjnych lub Åšle oznaczonych danych, jak to widać w pierwszym porozumieniu EEOC dotyczącym sztucznej inteligencji. Te poraÅžki nie są tylko techniczne. Są to poraÅžki wizerunkowe i finansowe, i wynikają z systemÃģw sztucznej inteligencji, ktÃģre zostały wyszkolone na niewiarygodnych danych.

Badania branÅžowe potwierdzają skalę tego problemu. Gartner donosi, Åže 80 procent projektÃģw sztucznej inteligencji nie udaje się skalować z powodu słabej jakości i zarządzania danymi. Podobnie, ankieta MIT Sloan Management Review wykazała, Åže problemy z danymi, a nie algorytmy, są głÃģwnym powodem, dla ktÃģrego projekty sztucznej inteligencji w przedsiębiorstwach zawodzą.

Kultura jest rÃģwnie waÅžna jak kod

Poprawa jakości danych nie jest czymś, co moÅžna naprawić za pomocą jednego narzędzia lub polecenia. Wymaga zmiany kulturowej. Dlatego liderzy biznesu muszą traktować dane jako Åžywy system, ktÃģry wymaga opieki i odpowiedzialności. To nie jest tylko oświadczenie, Åže “chcemy uczynić dane lepszymi” – to nie wystarczy. KaÅžda część organizacji musi zrozumieć, jak informacje są przekazywane, kto je posiada i co się dzieje, gdy się zmieniają.

Widzieliśmy, jak to się odbywa w prawdziwych systemach. Wiele aplikacji sztucznej inteligencji opiera się na nocnych aktualizacjach danych. Jeśli Twoja baza danych jest aktualizowana raz dziennie, wiedza Twojego modelu zawsze będzie opÃģÅšniona w stosunku do rzeczywistości. W szybko zmieniających się środowiskach ten opÃģÅšnienie moÅže oznaczać przestarzałe wnioski i złe decyzje. Firmy muszą przemyśleć cały przepływ danych, od tego, jak informacje są zbierane, do tego, jak są dostarczane do modelu.

Robienie tego dobrze moÅže zaoszczędzić ogromne ilości czasu i pieniędzy. Kiedy potoki danych są zaprojektowane z wyrazistością i celem, systemy sztucznej inteligencji mogą uczyć się i działać na najbardziej aktualnych i istotnych informacjach. Kiedy nie są, zespoły spędzają więcej czasu na czyszczeniu danych niÅž na ich uÅžywaniu.

Eksperci w zarządzaniu danymi często podkreślają, Åže kluczem do silnej jakości danych jest pętla sprzęŞenia zwrotnego między ludÅšmi, procesami i platformami. Bez tej pętli informacje stają się stare i modele tracą kontakt z warunkami świata rzeczywistego – problem, ktÃģry czasami nazywa się dryftem danych.

Balance między szybkością a integralnością

Często istnieje napięcie między szybkością a dokładnością. Wiele organizacji chce natychmiastowych wynikÃģw z inwestycji w sztuczną inteligencję, ale pośpiech moÅže prowadzić do większych problemÃģw pÃģÅšniej. Celem powinna być elastyczność danych z integralnością. Innymi słowy, budowanie systemÃģw, ktÃģre mogą poruszać się szybko bez utraty precyzji.

W tym celu kaÅžda firma powinna określić wyraÅšne ścieÅžki, aby dane płynęły z ich ÅšrÃģdła do modelu w czasie rzeczywistym. Pomaga to rÃģwnieÅž określić, jaki rodzaj informacji jest dozwolony i co musi pozostać poza modelem. WraÅžliwe lub prywatne dane nie powinny nigdy dotrzeć do modelu, nawet jeśli uÅžytkownik technicznie ma do nich dostęp. Ochrona tej granicy buduje zaufanie i utrzymuje systemy sztucznej inteligencji przed ujawnieniem lub niewłaściwym uÅžyciem informacji.

Podczas gdy sztuczna inteligencja staje się bardziej autonomiczna, nadzÃģr ludzki pozostanie krytyczny. Model nie powinien mieć pełnej kontroli nad działaniami biznesowymi. Nie powinien rÃģwnieÅž podejmować decyzji. Zamiast tego powinien składać wnioski. Co więcej, ludzie muszą zawsze przeglądać i zatwierdzać jego działania, aby upewnić się, Åže są zgodne z polityką firmy i regulacjami.

Budowanie jakości od podstaw

Utrzymywanie jakości danych w skali nie jest tylko kwestią czyszczenia błędÃģw. Zaczyna się od architektury. Trzeba określić, gdzie znajdują się Twoje najbardziej wiarygodne dane, a następnie zaprojektować system, ktÃģry łączy je w jednej zaufanej lokalizacji. Stamtąd moÅžna śledzić, ktÃģre dane model uÅžywa i skąd pochodzą.

Ten podejście zapobiega zamieszaniu i utrzymuje system transparentny. Pomaga rÃģwnieÅž zespołom rozwiązywać problemy szybciej, gdy coś pÃģjdzie nie tak. Kiedy wiesz dokładnie, ktÃģre dane karmiły odpowiedÅš modelu, moÅžesz zweryfikować i poprawić problemy, zanim się rozprzestrzenią.

Przyszłość sztucznej inteligencji w przedsiębiorstwach będzie naleÅžeć do firm, ktÃģre wbudowują jakość w swoją infrastrukturę domyślnie. Oczekujemy, Åže zobaczymy więcej gotowych systemÃģw sztucznej inteligencji, ktÃģre obsługują zarÃģwno rozumowanie, jak i integrację danych w jednym pakiecie. Te “urządzenia sztucznej inteligencji” mogą ułatwić firmom wdroÅženie inteligentnych systemÃģw bez utraty kontroli nad danymi.

Analitycy przewidują, Åže organizacje, ktÃģre są w stanie ujednolicić i zarządzać swoimi danymi skutecznie, zobaczą szybsze wdroÅženie i wyÅžszy zwrot z inwestycji w projekty sztucznej inteligencji. Ostatni raport o gotowości danych wyjaśnia, Åže ta zdolność oddziela firmy, ktÃģre innowują ciągle, od tych, ktÃģre zatrzymują się po wstępnych testach. RÃģÅžnica często sprowadza się do tego, czy ich systemy sztucznej inteligencji są zbudowane na spÃģjnych, dobrze ustrukturyzowanych informacjach.

Podsumowanie

Jakość danych moÅže nie brzmieć ekscytująco w porÃģwnaniu z przełomami w projekcie modelu, ale jest cichą siłą, ktÃģra decyduje, czy sztuczna inteligencja powiedzie się, czy nie. Bez czystych, aktualnych i spÃģjnych danych, najbardziej zaawansowane systemy potkną się. Z nimi, nawet skromne projekty sztucznej inteligencji mogą tworzyć trwałą wartość.

KaÅždy lider inwestujący w sztuczną inteligencję powinien zadać sobie proste pytanie: Czy ufamy danym, ktÃģre napędzają nasze decyzje? Z tego, co widzieliśmy, firmy, ktÃģre mogą odpowiedzieć “tak” z pewnością, są juÅž liderami w wyścigu sztucznej inteligencji.

Oren Eini jest załoÅžycielem i dyrektorem generalnym RavenDB, wielomodelowej bazy danych NoSQL dokumentowej, zaufanej przez deweloperÃģw i przedsiębiorstwa na całym świecie. OprÃģcz bycia siłą napędową za wzrostem i rozwojem bazy danych RavenDB, Oren jest aktywnym blogerem i regularnie występuje na wydarzeniach branÅžowych na całym świecie.