Kąt Andersona

Dlaczego AI nie może po prostu przyznać, że nie zna odpowiedzi?

mm
Dodaj Unite.AI do preferowanych źródeł w Google
Flux1.D Pro, Flux Kontext Pro, Firefly V3.

Duże modele językowe często podają pewne odpowiedzi, nawet gdy pytanie nie może być odpowiedzi. Nowe badania pokazują, że te modele często rozpoznają problem wewnętrznie, ale nadal podają jakąś odpowiedź, narażając na jaw ukrytą lukę między tym, co wiedzą, a tym, co mówią.

 

Osoba, która spędziła rozsądną ilość czasu z wiodącym dużym modelem językowym, takim jak ChatGPT lub Qwen, doświadczyła sytuacji, w których model podaje błędną odpowiedź (która może mieć lub nie mieć katastrofalnych konsekwencji, w zależności od tego, jak bardzo na niej polegała) – i gdy błąd stał się oczywisty, model jedynie przeprosił.

Dlaczego wiodące LLM mają trudności z przyznaniem, że nie znają odpowiedzi na pytanie, jest to niewielka, ale rosnąca dziedzina badań. Odpowiedź “pewna, ale błędna” może być szczególnie szkodliwa w przypadku silnie ocenzurowanego i filtrowanego interfejsu API, takiego jak ChatGPT, ponieważ takie modele agresywnie blokują treści NSFW lub inne “naruszające reguły” dane wejściowe lub wyjściowe.

To może dać użytkownikowi fałszywe wrażenie, że model jest decyzyjny i kardynalny, podczas gdy w rzeczywistości odmowa pochodziła z tradycyjnego heurystycznego lub opartego na liście blokowania filtra, zaprojektowanego w celu ograniczenia ekspozycji prawnego gospodarza na wszelkie koszty, a nie z jakichkolwiek spostrzeżeń AI.

Z pracy 'AbstentionBench' z czerwca 2025 roku z FAIR w Meta - po lewej, rysunek przedstawia zakres typów niepowodzeń przechwyconych w AbstentionBench, który testuje zachowanie modelu na ponad 35 000 nieodpowiednich pytań; w środku, przykład pokazuje, jak modele często odpowiadają sfabrykowanymi odpowiedziami zamiast przyznawać, że brakuje im wystarczającej ilości informacji; a po prawej, abstencja spada, gdy modele są dostosowane do rozumowania, a nie do followowania instrukcji. Źródło: https://arxiv.org/pdf/2506.09038

Z pracy ‘AbstentionBench’ z czerwca 2025 roku z FAIR w Meta – po lewej, rysunek przedstawia zakres typów niepowodzeń przechwyconych w AbstentionBench, który testuje zachowanie modelu na ponad 35 000 nieodpowiednich pytań; w środku, przykład pokazuje, jak modele często odpowiadają sfabrykowanymi odpowiedziami zamiast przyznawać, że brakuje im wystarczającej ilości informacji; a po prawej, abstencja spada, gdy modele są dostosowane do rozumowania, a nie do followowania instrukcji. Źródło: https://arxiv.org/pdf/2506.09038

Nowy artykuł z Chin utrzymuje, że modele LLM w rzeczywistości potajemnie wiedzą, że nie mogą odpowiedzieć na pytanie zadane przez użytkownika, ale że są zmuszone do podania jakiejś odpowiedzi, zwykle zamiast mieć wystarczającą pewność, by zdecydować, że prawidłowa odpowiedź nie jest dostępna z powodu braku informacji od użytkownika, ograniczeń modelu lub innych powodów.

Artykuł stwierdza:

‘[Pokażemy], że [LLM] posiadają wystarczające zdolności poznawcze, aby rozpoznać błędy w tych pytaniach. Niemniej, nie wykazują odpowiedniego zachowania abstencji, ujawniając niezgodność między ich wewnętrznym poznaniem a zewnętrzną odpowiedzią.’

Badacze opracowali lekki, dwuetapowy podejście, które wykorzystuje monitorowanie poznawcze/probing do skanowania wewnętrznego procesu LLM w celu wykrycia oznak, że model zdaje sobie sprawę, iż nie może dostarczyć odpowiedzi; a następnie interweniuje, aby upewnić się, że “pomocna” natura modelu nie pogarsza problemów użytkownika, prowadząc go w złym lub destrukcyjnym kierunku.

Badanie wykorzystuje celowo niedookreślone pytania matematyczne, aby przetestować, czy modele mogą rozpoznać, kiedy odpowiedź jest nieznana; jednak ten zestaw danych naraża się na ryzyko, że zadanie zostanie potraktowane jako “sztuczka”. W rzeczywistości modele napotykają znacznie więcej rutynowych powodów, aby powstrzymać się od odpowiedzi, od niejasnego sformułowania do luk w wiedzy dziedzinowej.

Nowa praca tytułowana Odpowiadanie na nieodpowiedzialne jest błędem: analiza i łagodzenie niepowodzeń abstencji w dużych modelach rozumowania, pochodzi od czterech badaczy z State Key Laboratory for Novel Software Technology i National Institute of Healthcare Data Science na Uniwersytecie w Nanjing.

Metoda

(Ponieważ nie ma odpowiednich rywali, aby porównać podejście autorów, i ponieważ praca ta ma nieco niekonwencjonalny format, postaramy się trzymać go jak najlepiej.)

Zgodnie z poprzednimi podejściami, autorzy skupili się na przedstawieniu LLM z nieodpowiednimi pytaniami matematycznymi z Synthetic Unanswerable Math (SUM) zestawu danych, oceniając pięć rodzin modeli: z serii DeepSeek, R1-Distill-Llama-8B; R1-Distill-Qwen-7B, R1-Distill-Qwen-14B; oraz z serii Qwen, Qwen3-8B, a także Qwen3-14B.

Nieodpowiednie problemy w SUM zostały utworzone przez usunięcie lub skorumpowanie niezbędnych elementów na pięć sposobów: usunięcie kluczowych informacji; wprowadzenie niejasności; nałożenie niewykonalnych warunków; odniesienie do niezwiązanych obiektów; lub usunięcie pytania w całości.

Następnie wybrano próbkę 1 000 takich przypadków do analizy, a GPT-4o wygenerował lakoniczne wyjaśnienia, które posłużyły jako podstawa do oceny.

Odpowiedzi modeli na nieodpowiednie pytania zostały ocenione przy użyciu standardowych prompty z budżetem 10 000 tokenów, podczas którego zaobserwowano trzy główne wzorce zachowania: w pierwszym model rozpoznał pytanie jako nierozwiązywalne i powstrzymał się – zwykle odpowiadając wyraźnym wyrazem niepewności; w drugim wyprodukował pełną odpowiedź, wymyślając brakujące informacje, takie jak wprowadzenie nieistniejącej $9,99 opłaty za obsługę, aby uzasadnić wynik końcowy (patrz poniższy rysunek); W trzecim, określanym jako utknięcie poznawcze, model utknął w przedłużonej pętli rozumnienia, trwale trzymając się nieważnych ścieżek rozwiązania, nawet po niejawnej akceptacji, że pytanie nie miało sensownej odpowiedzi:

Różne wyniki odpowiedzi na niemożliwe pytanie.

Różne wyniki odpowiedzi na niemożliwe pytanie.

Artykuł przedstawia tendencję, w której większe modele częściej powstrzymują się od odpowiedzi na nieodpowiednie pytania, przy jednoczesnym spadku sfabrykowanych odpowiedzi i zachowań utknięcia:

Rozbicie odpowiedzi modeli na nieodpowiednie problemy matematyczne, pokazujące względną częstotliwość poprawnych powstrzymań, sfabrykowanych odpowiedzi i utknięć poznawczych w różnych skalach modeli.

Robienie odpowiedzi modeli na nieodpowiednie problemy matematyczne, pokazujące względną częstotliwość poprawnych powstrzymań, sfabrykowanych odpowiedzi i utknięć poznawczych w różnych skalach modeli.

Jednak ta zmiana jest ograniczona skalą, pozostawiając znaczną część przypadków nierozwiązanych przez poprawne powstrzymanie, co sugeruje, że sama zwiększona pojemność nie daje gwarancji bardziej ostrożnego zachowania.

Świadomość impasu

Aby przetestować, czy modele językowe mogą rozpoznać, kiedy pytanie nie ma odpowiedzi, badacze przerwali część rozumnienia modelu i poprosili o ostateczną odpowiedź lub o wyjaśnienie dlaczego pytanie było nieodpowiednie.

Dla przypadków, w których model trwał w nieskończonej pętli, zatrzymali go na słowie “czekaj” i poprosili o odpowiedź; w przypadkach, w których model szybko sfabrykował odpowiedź, wstawili przerwę na granicy akapitu.

Wykres po lewej pokazuje, jak często modele dają poprawne powstrzymania, gdy są przerywane w trakcie rozumnienia, z wyższymi wskaźnikami dla przypadków utknięcia niż dla sfabrykowanych odpowiedzi. Wykres po prawej stronie pokazuje, że większość modeli może wyjaśnić, dlaczego pytanie jest nieodpowiednie, nawet jeśli ich ostateczne odpowiedzi nie odzwierciedlają tego zrozumienia.

Wykres po lewej pokazuje, jak często modele dają poprawne powstrzymania, gdy są przerywane w trakcie rozumnienia, z wyższymi wskaźnikami dla przypadków utknięcia niż dla sfabrykowanych odpowiedzi. Wykres po prawej stronie pokazuje, że większość modeli może wyjaśnić, dlaczego pytanie jest nieodpowiednie, nawet jeśli ich ostateczne odpowiedzi nie odzwierciedlają tego zrozumienia.

W wielu z tych przypadków model podał poprawne powstrzymanie lub wyraźne wyjaśnienie, nawet jeśli wcześniej wyprodukował błędną odpowiedź. Autorzy sugerują, że to wskazuje, iż model często rozpoznaje problem podczas swojego rozumnienia, ale nie potrafi działać zgodnie z tym zrozumieniem w swoim ostatecznym wyjściu.

Czytanie w myślach LLM

Aby przetestować, czy modele językowe wewnętrznie śledzą, czy pytanie jest odpowiednie, badacze przeszkolili małe klasyfikatory na ukrytych aktywacjach modeli podczas rozumnienia, co pozwoliło im sprawdzić, czy różnica między odpowiednim a nieodpowiednim pytaniem była już obecna w wewnętrznych sygnałach modelu – nawet jeśli nie była odzwierciedlona w jego ostatecznym wyjściu.

Budując na idei, że wysokie poziomy pojęć, takie jak prawdziwość lub płeć, mogą być liniowo osadzone w aktywacjach modelu, ‘odpowiedzialność’* została przetestowana na podobne reprezentacje.

Proste klasyfikatory liniowe (sondy) zostały przeszkolone na ukrytych aktywacjach w różnych warstwach modelu, wykorzystując dane wyjściowe z mechanizmu uwagi wielogłowej zaraz przed połączeniem resztowym.

Każda sonda została przeszkolona, aby odróżnić pytania odpowiednie od nieodpowiednich, na podstawie wewnętrznych aktywacji z procesu rozumnienia. Dane wejściowe składały się z 2 200 par pytań pobranych z zestawu danych SUM, z których 2 000 zostało wykorzystanych do szkolenia, a 200 do walidacji.

Podczas inferencji przewidywania modelu było uśrednione w czasie, po tokenach widzianych do tego punktu w sekwencji rozumnienia, co pozwoliło sondzie śledzić, jak sygnały związane z odpowiedzialnością pojawiają się w czasie:

Dokładność klasyfikacji sond liniowych przeszkolonych do odróżniania pytań odpowiednich od nieodpowiednich, mierzona w różnych punktach procesu rozumnienia. Dokładność ogólnie poprawia się wraz z postępem rozumnienia, a większe modele osiągają ponad 85% w końcowych etapach.

Dokładność klasyfikacji sond liniowych przeszkolonych do odróżniania pytań odpowiednich od nieodpowiednich, mierzona w różnych punktach procesu rozumnienia. Dokładność ogólnie poprawia się wraz z postępem rozumnienia, a większe modele osiągają ponad 85% w końcowych etapach.

Jak widać powyżej, dokładność sondy stale poprawia się wraz z postępem rozumnienia, a większość modeli przekracza 80% dokładności klasyfikacji na końcowych etapach – co świadczy o tym, że nawet gdy zewnętrzne zachowanie modelu nie odzwierciedla tego, wewnętrzne reprezentacje często zawierają wyraźny sygnał wskazujący, czy pytanie może być odpowiednie.

Upór

Chociaż wcześniejsze wyniki sugerują, że duże modele językowe często rozpoznają, kiedy pytanie nie może być odpowiednie, artykuł zauważa, że nadal mają tendencję do kontynuowania generowania odpowiedzi zamiast powstrzymania się.

Aby zbadać tę niezgodność, badacze przeanalizowali pewność modeli w powstrzymywaniu się w określonych punktach procesu rozumnienia, porównując pewność modeli w trzech kategoriach wyjściowych: poprawne powstrzymanie; sfabrykowana odpowiedź; oraz utknięcie poznawcze.

Równoliczne próbki zostały wykorzystane dla każdej kategorii, a pewność została zdefiniowana jako średnia maksymalna prawdopodobieństwo przypisana do każdego tokenu wyjściowego w czasie dekodowania, na podstawie sformułowania z poprzednich badań. Jak widać na poniższym wykresie, zarówno sfabrykowane odpowiedzi, jak i przypadki utknięcia poznawczego wykazywały niższą pewność powstrzymywania się w porównaniu z poprawnym powstrzymywaniem:

Poziomy pewności związane z generowaniem odpowiedzi powstrzymującej 'Nie wiem' w różnych typach odpowiedzi.

Poziomy pewności związane z generowaniem odpowiedzi powstrzymującej ‘Nie wiem’ w różnych typach odpowiedzi.

Badacze również zmierzyli, jak często modele produkowały odpowiedź ‘Nie wiem’ w trakcie procesu rozumnienia. Poniższy wykres wskazuje, że przypadki poprawnego powstrzymania dawały wyższą częstotliwość powstrzymywania, podczas gdy dwie pozostałe kategorie produkowały takie odpowiedzi rzadziej:

Częstotliwość odpowiedzi 'Nie wiem' obserwowanych w punktach zatrzymania w trakcie rozumnienia, wyświetlanych dla różnych typów wyników odpowiedzi.

Częstotliwość odpowiedzi ‘Nie wiem’ obserwowanych w punktach zatrzymania w trakcie rozumnienia, wyświetlanych dla różnych typów wyników odpowiedzi.

Te wyniki sugerują, twierdzą autorzy, że chociaż modele mogą wewnętrznie wykryć nieodpowiedniość, często brakuje im pewności, aby działać zgodnie z tym zrozumieniem, co wskazuje na trwałą preferencję do kontynuowania zadania zamiast przyznania niepewności.

Testy

W oparciu o te wyniki, badacze opracowali dwuetapową metodę mającą na celu poprawienie powstrzymywania się. Pierwszy etap, monitorowanie poznawcze, śledzi ukryte stany modelu w trakcie inferencji, dzieląc proces rozumnienia na naturalne jednostki, takie jak klauzule lub przerwy, oznaczone słowami takimi jak ‘czekaj’.

Na końcu każdej sekcji lekka, liniowa sonda przeszkolona na wewnętrznych sygnałach związanych z odpowiedzialnością szacuje prawdopodobieństwo, że pytanie nie może być odpowiednie. Jeśli to prawdopodobieństwo przekracza ustalony próg, proces przechodzi do drugiego etapu: interwencji w trakcie inferencji, która kieruje model w stronę powstrzymywania się zamiast sfabrykowania odpowiedzi.

Gdy model wykazuje wewnętrzne oznaki, że pytanie nie może być odpowiednie, rozumnienie jest przerywane interwencją, która wzmacnia to zrozumienie i zwiększa prawdopodobieństwo powstrzymywania się. Jak widać poniżej, interwencja reprezentuje ‘wskazówkę prowadzenia’, która przypomina modelowi, że pytanie może nie mieć ważnej odpowiedzi:

Wskazówka do kondycjonowania interwencji w trakcie inferencji.

Wskazówka do kondycjonowania interwencji w trakcie inferencji.

Metoda ta również obejmuje mechanizm wczesnego zakończenia, który zapobiega niepotrzebnemu kontynuowaniu sekwencji rozumnienia, zachęcając model do traktowania powstrzymywania się jako uzasadniony i czasem preferowany wybór.

Do fazy testowej badacze wykorzystali dwa zestawy danych: Unanswerable Math Word Problem (UMWP) oraz wcześniej wspomniany SUM.

Zestaw testowy SUM składał się z 284 nieodpowiednimi i 284 odpowiednimi, ręcznie sprawdzonymi pytaniami. UMWP został zbudowany z czterech źródeł pytań słownych matematycznych: SVAMP; MultiArith; Grade School Math (GSM8K); oraz ASDiv.

Cały zestaw danych składał się z 5 200 problemów, z których 600 zostało wybranych do testowania, podzielonych równo między nieodpowiednie i odpowiednie pytania. Dla nieodpowiednich elementów w UMWP, GPT-4o wygenerował podstawowe wyjaśnienia, dlaczego nie mogły być rozwiązane.

Metryki

Wydajność modelu została zmierzona przy użyciu czterech metryk: wskaźnik powstrzymywania się, czyli udział nieodpowiednich pytań, w których model poprawnie powstrzymuje się, odpowiadając “Nie wiem”, zgodnie z instrukcjami; dokładność powodu, czyli procent nieodpowiednich pytań, w których model daje ważne wyjaśnienie, dlaczego pytanie nie może być rozwiązane; użycie tokenów, szczegółowo opisujące liczbę tokenów wygenerowanych w trakcie rozumnienia; oraz dokładność odpowiedzi, czyli udział odpowiednich pytań, w których model produkuje poprawne rozwiązanie końcowe.

Testy podstawowe

Ponieważ nie istnieją standardowe punkty odniesienia dla tego problemu, badacze porównali swoją metodę z dwiema alternatywami, Dynasor-CoT i Dynamic Early Exit in Reasoning Models (DEER), przy założeniu, że poprawne powstrzymanie się powinno być traktowane jako poprawna odpowiedź, gdy pytanie nie ma rozwiązania.

Dynasor-CoT nakazuje modelom produkowanie pośrednich odpowiedzi i zatrzymuje się, gdy ta sama odpowiedź pojawia się trzykrotnie z rzędu, podczas gdy DEER monitoruje pewność na poziomie zdania i zatrzymuje rozumnienie, gdy próg jest osiągnięty.

Trzeci punkt odniesienia, zwany Vanilla, odnosi się do niezmodyfikowanych wyjść modelu. Testy wykorzystywały pięć wariantów Qwen i DeepSeek.

Łączne wyniki są pokazane poniżej:

Porównanie różnych metod na odpowiednie i nieodpowiednie pytania w dużych modelach rozumnienia, z najwyższymi wartościami w każdej kolumnie wyróżnionymi pogrubieniem.

Porównanie różnych metod na odpowiednie i nieodpowiednie pytania w dużych modelach rozumnienia, z najwyższymi wartościami w każdej kolumnie wyróżnionymi pogrubieniem. Proszę odnieść się do oryginalnego artykułu, aby uzyskać lepszą rozdzielczość.

Nowe podejście wyprodukowało najwyższe wskaźniki powstrzymywania się i dokładne powody na nieodpowiednich pytaniach. Dla odpowiednich pytań dokładność pozostała bliska tej, którą osiągały modele vanilla, a czasem nawet się poprawiła, co sugeruje, że normalne rozwiązywanie problemów nie zostało naruszone.

Użycie tokenów również spadło o 30% do 50% w przypadkach nieodpowiednich i nieznacznie w przypadkach odpowiednich, co wskazuje na większą wydajność.

Stwierdzono również związek między wskaźnikiem powstrzymywania się a dokładnością powodu, ponieważ modele, które częściej powstrzymywały się, również dawały lepsze wyjaśnienia, co autorzy interpretują jako poprawę jakości rozumnienia.

Modele Qwen generalnie przewyższały wersje oparte na destylacji (kwantyzacji), podczas gdy większe modele wykazywały silniejszą zdolność do powstrzymywania się, co wskazuje, że zarówno architektura, jak i skala są ważne dla niezawodnego wykrywania nieodpowiedniości.

W końcu autorzy donoszą, że ich nowa metoda redukuje sfabrykowane odpowiedzi i utknięcia, zwiększając wskaźnik poprawnych powstrzymań, podczas gdy podejścia bazujące tylko na ‘wczesnych zakończeniach’ czasem prowadzą do większej liczby sfabrykowanych odpowiedzi.

Raportują również zyski w pewności i częstotliwości odpowiedzi “Nie wiem”, z monitorowaniem opartym na ukrytych sygnałach okazując się bardziej skutecznym niż strategie oparte na sygnałach behawioralnych.

Wnioski

Niezdolność LLM do powstrzymywania się od odpowiedzi na pytanie, gdy jest to konieczne, jest jednym z największych punktów tarcia w środowisku użytkownika AI, nie tylko dlatego, że inne cechy interfejsu dają użytkownikowi iluzję, że AI jest zdolne do ostrożnych odpowiedzi, kiedy tak naprawdę nie jest – przynajmniej na razie.

Jedną z obaw dotyczących bezpośredniej interwencji, która nie wynika bezpośrednio z “charakteru” modelu, jest to, że może być nadmiernie lub niewystarczająco wykorzystywana, w zależności od tego, czy wykryte aktywacje są naprawdę istotne dla modelu, aby uznać porażkę.

Dalej, logistyczny koszt monitorowania sondy liniowej nie jest prawdopodobnie nieznaczny, i możliwe, że prostsze heurystyczne metody, podobne do tych, które chronią użytkowników przed zakazaną treścią, mogą być tańszym rozwiązaniem, jeśli punkty kotwiczące mogą być wystarczająco określone.

 

* Naturalnie to nie zgadza się z pozornym synonimem ‘odpowiedzialność’, ale raczej określa, czy dane pytanie może być odpowiednie w ogóle.

Po raz pierwszy opublikowano w środę, 27 sierpnia 2025

Pisarz zajmujący się uczeniem maszynowym, specjalista w dziedzinie syntezy ludzkich obrazów. Były szef ds. treści badawczych w Metaphysic.ai, aż do jej rozwiązania w Brahma.ai firmy DNEG.
Strona internetowa: martinanderson.ai
Kontakt: martin@martinanderson.ai