Liderzy opinii

Architektura przeglądu ma większe znaczenie niż model w przedsięwzięciach AI

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Następna faza dojrzałości AI w przedsięwzięciach zależy mniej od lepszych modeli, a bardziej od budowania godnej zaufania architektury wokół nich.

Każda rozmowa o zarządzaniu AI, której byłam częścią przez ostatnie dwa lata, wraca do tych samych problemów: wskaźniki halucynacji, benchmarki dokładności i testy zgodności. Są to rzeczywiste problemy, oczywiście, ale rozmowa była skupiona na niewłaściwym końcu problemu.

Chociaż modele znacznie się poprawiły, liczba nieweryfikowanych wyjść AI, które docierają do seniorów, wzrosła wraz z nimi. Ten brak nadzoru wskazuje na problem architektury przeglądu, a branża ledwie o tym rozmawia.

Opowieść o modelu wyprzedziła rzeczywistość

Dominujący punkt widzenia w przedsięwzięciach AI nadal traktuje jakość modelu jako podstawową zmienną: jeśli model jest wystarczająco dokładny, wyjście jest godne zaufania. Ta logika była zrozumiała dwa lata temu, gdy wczesne LLM były mniej spójne i bardziej podatne na halucynację, ale sytuacja się zmieniła.

Dzisiejsze modele produkują wyrafinowane, dobrze sformatowane odpowiedzi na ogromny zakres zadań, sformatowane w języku gotowym do udostępnienia interesariuszom. Organizacje teraz używają AI w objętości, która znacznie przekracza to, czego ich procesy przeglądu były w stanie obsłużyć. Badania nad wdrożeniem AI w przedsięwzięciach udokumentowały tę niezgodność w rozwoju oprogramowania, gdzie rozwijający się z pomocą AI deweloperzy wykonują o 21% więcej zadań, podczas gdy czas przeglądu pull-requestów wzrasta o 91%. Produkcja rośnie, więc możliwość jest już nie jest wąskim gardłem. Możliwość przeglądu jest prawdziwym przeszkodą.

Co pokazują dane w pracy analitycznej

Branża analityczna jest korzystnym miejscem do zbadania tego problemu, ponieważ profesjonaliści analityczni są wyuczonymi sceptykami. Wiedzą, jaka jest różnica między korelacją, przyczynowością, wynikami a wnioskami. Kwestionowanie jakości danych jest częścią pracy.

Według Knit AI Trust Index, 92% ankietowanych profesjonalistów z branży analitycznej twierdzi, że wyjścia AI docierają do kierownictwa seniorów bez kompleksowego przeglądu.
Wyniki Trust Index wskazują na trzy główne punkty nacisku:

  • Objętość przewyższa możliwość weryfikacji. Zespoły generują więcej wyjść, niż mają możliwość dokładnego ich sprawdzenia.
  • Wiara w AI wzrosła szybciej niż zachowania weryfikacyjne. Badacze czują się ogólnie pozytywnie wobec jakości AI, jednocześnie przyznając, że ich praktyki przeglądu nie zmieniły się znacząco.
  • Narzędzia do przeglądu pracy AI pozostają w tyle za narzędziami do jej generowania. Organizacje zainwestowały znacznie w możliwości generowania, a stosunkowo niewiele w infrastrukturę do przeglądu i śledzenia tego, co AI wygenerowało.

Wyrafinowane wyjścia AI zachęcają do mniejszej kontroli

Trudniejszy tryb awarii nie jest przypadkiem, w którym AI generuje wyraźnie błędną odpowiedź, a ktoś ją wyłapuje. Trudniejszym problemem jest bias automatyzacji, tendencja do zmniejszania kontroli wyjść, które wyglądają autorytatywnie i są dobrze sformatowane. Systematyczne badanie z 2025 r. opublikowane w AI & Society zbadało to w 35 recenzowanych studiach i stwierdziło, że wyrafinowane, pełne zaufania wyjścia AI konsekwentnie zmniejszają głębokość przeglądu ludzkiego — nawet wśród doświadczonych profesjonalistów. Gdy coś wygląda prawidłowo, przydzielamy mniej uwagi do sprawdzenia, czy jest to prawidłowe.

Ten brak nadzoru tworzy problem propagacji. Wyjście badawcze, które analityk tylko lekko sprawdza, staje się punktem danych w prezentacji na poziomie VP, który staje się podstawą dyskusji na poziomie zarządu. Gdy błąd podróżuje tak daleko, jego pochodzenie jest niewidoczne, a jego poprawa jest droga. Globalne straty biznesowe z powodu nieścisłości AI przekroczyły 67 miliardów dolarów w 2024 r.. Koszty weryfikacji na pracownika mogą sięgać 14 200 dolarów rocznie, tylko za sprawdzenie, czy zawartość wygenerowana przez AI jest dokładna. Ponownie, są to nie problemy z jakością modelu, ale problemy z architekturą przeglądu.

Czym są dojrzałe przepływy pracy AI

Organizacje, które dobrze radzą sobie z tym problemem, nie używają lepszych modeli niż ktokolwiek inny. Zamiast tego zbudowały bardziej gruntowną infrastrukturę przeglądu wokół modeli, które wykorzystują. Cztery zasady definiują ich podejście:

  1. Widoczne pochodzenie

Każde wyjście AI niesie przejrzysty zapis pochodzenia wejść. Ten zapis daje przeglądającym cenną wiedzę na temat tego, co należy ocenić, aby wyjścia były sprawdzane wydajnie. Nie można ocenić twierdzenia, którego pochodzenie jest niewidoczne.

  1. Przegląd warstwowy według stawek

Nie wszystkie wyjścia AI niosą ze sobą takie same ryzyko. Dojrzałe przepływy pracy stosują intensywność przeglądu proporcjonalnie do konsekwencji błędu. Wyjścia o wysokim ryzyku otrzymują więcej uwagi i strukturalnych kroków weryfikacji. Rutynowe wyjścia są przetwarzane szybciej.

  1. Tarcie w odpowiednich miejscach

Organizacje, które mają największe problemy z zaufaniem do AI, usunęły tarcie jednolicie, traktując szybkość jako powszechny cel. Te, które są najbardziej udane, były wybiórcze: zachowały zamierzone tarcie w punktach przekazania, w których wyjścia AI stają się decyzjami organizacyjnymi. Ich procesy wymagają zatwierdzenia przed wprowadzeniem AI do prezentacji zarządu lub strukturalnego kroku wyzwania przed wprowadzeniem wyników do dyskusji strategicznych.

  1. Pętle sprzężenia zwrotnego do warstwy modelu

Najlepsze przepływy pracy traktują przegląd jako proces generujący dane, a nie punkt kontrolny. Gdy przeglądający oznacza błąd lub zastępuje rekomendację AI, sygnał ten jest przechwycony i wprowadzony z powrotem do sposobu, w jaki AI jest wdrożona w przyszłej pracy. Raport OpenAI o stanie AI w przedsięwzięciach z 2025 r. stwierdził, że najlepsze organizacje wyróżniają się nie tyle zaawansowaniem swoich modeli, co rygorem procesów wdrożeniowych. Organizacje bez tej pętli sprzężenia zwrotnego zaczynają od zera za każdym razem.

Następna faza zostanie wygrana na poziomie przeglądu

Rzeczywistą przewagą konkurencyjną w branży analitycznej jest to, kto może konsekwentnie ufać temu, co produkuje. To zaufanie pochodzi z wiedzy o pochodzeniu wyjścia, kto je przeglądał i co się stało, gdy coś było nie tak. Ostatnia historia odpowiedziała na pytanie o model; organizacyjna infrastruktura do odpowiedzialnego wdrożenia modeli w skali jest miejscem, w którym branża wciąż dogania.

Fakt, że 92% profesjonalistów z branży analitycznej widziało nieweryfikowaną zawartość AI, która dociera do kierownictwa seniorów, nie jest awarią technologiczną. Jest to awaria projektowania organizacyjnego i pojawia się we wszystkich branżach, gdzie szybkość została zoptymalizowana, a przegląd został potraktowany jako koszt. Firma z najmądrzejszym modelem nie wygra następnej fazy AI w przedsięwzięciach, ale firma z najbardziej godną zaufania architekturą przeglądu wokół niego.

Aneesh Dhawan jest współzałożycielem i dyrektorem generalnym Knit, agencji badawczej AI-Native. Przez ostatnie 5 lat pracował na styku przedsiębiorczego AI i metodologii badań. Knit współpracuje z organizacjami, w tym Google, Amazon, T-Mobile i ESPN, aby dostarczać gotowe do podjęcia decyzji informacje z prędkością AI.