Kąt Andersona

Nadawanie modelom językowym “przełącznika prawdy”

mm
Dodaj Unite.AI do preferowanych źródeł w Google
AI-generated image of a retro dial that goes from 'BULL' to 'FACT', GPT5.2's (unknown) underlying model + SDXL for outpainting.

Prawda czy gadatliwość: wybierz jedną. Nowa metoda szkolenia pozwala użytkownikom nakazywać botom czatowym, jak “dokładne” mają być, zmieniając dokładność w przełącznik, który można ustawić w górę lub w dół.

 

Nowe badanie współpracy między USA a Chinami oferuje coś, czego prawie wszyscy użytkownicy botów czatowych byliby wdzięczni: wirtualny “przełącznik”, który mówi botowi, czy ma być “gadatliwy” czy “prawdziwy”.

System został stworzony przez doskonalenie modelu Mistral-7B na danych syntetycznych, tak aby schemat dla skali “prawdy” mógł być wydrukowany na modelu. Po tej rewizji model Mistral jest w stanie kontrolować liczbę faktów w odpowiedzi; im wyższa wartość “prawdy” podana przez użytkownika, tym mniej – ale pewniejszych – będzie krótsza odpowiedź.

Przy niższych ustawieniach odpowiedź bota staje się tym, co autorzy nazywają “informacyjną”, tj. daje dłuższą odpowiedź i zawiera więcej faktów; ale niektóre z tych faktów mogą być halucynacjami.

Dane syntetyczne, na których system został wyszkolony, wykorzystywały Wikipedię jako odniesienie dla testowego obszaru: prawdziwych faktów biograficznych o ludziach. Niezależnie od tego, czy uważa się, że Wikipedia powinna być autorytatywnym źródłem, wartość pracy polega na tym, że jest to system, który może ograniczać LLM’ów native skłonność do podawania odpowiedzi, nawet gdy nie ma odpowiedzi do podania.

Przykład z projektu FactScore, który umożliwił opracowanie zestawu danych dla artykułu, z wykorzystaniem Wikipedii jako odniesienia dla szczegółów biograficznych. Źródło - https://aclanthology.org/2023.emnlp-main.741.pdf

Przykład z projektu FactScore, który umożliwił opracowanie zestawu danych dla artykułu, z wykorzystaniem Wikipedii jako odniesienia dla szczegółów biograficznych. Źródło

Autorzy zauważają, że konteksty o wysokiej pewności, takie jak domeny medyczne i prawne, wymagają konserwatywnych i niezawodnie faktualnych danych wyjściowych, podczas gdy wielu innych użytkowników wymaga bardziej giętkiej i kreatywnej, interpretatywnej rodzaju danych wyjściowych (tj. pisanie dyskursywnego i analizy akademickiej, między innymi).

Oni obserwują*:

‘[Aktualne] LLM oferują żadnego wbudowanego mechanizmu do kontrolowania tego kompromisu.

‘Podczas gdy użytkownicy mogą próbować kierować zachowaniem modelu za pomocą podpowiedzi, takich jak “bądź bardziej faktualny”, stwierdzamy, że modele na granicy nie dostosowują się niezawodnie do takich podpowiedzi w tej pracy.

‘Na FactScore, stwierdzamy, że modele z półki często nie spełniają nawet umiarkowanych do surowych celów. Ta luka motywuje alternatywę, która pozwala użytkownikom żądać określonego poziomu faktualności i nakazywać modelowi dostosować swoje odpowiedzi odpowiednio.’

Tylko fakty

Aby zrozumieć artykuł i rozwiązania, które oferuje, konieczne jest przegląd własnej definicji “informatywności”. Autorzy stwierdzają, że ilościowa miara odpowiedzi “informatywnej” jest równa ‘ilości obszernej treści w danych wyjściowych, mierzonej jako liczba zwalidowanych atomowych stwierdzeń, znormalizowana przez długość danych wyjściowych’.

W innym miejscu artykuł stwierdza bardziej prosto, że informatywność jest ‘całkowita liczba atomowych faktów w danych wyjściowych, niezależnie od tego, czy są one prawidłowe, czy nie’.

Dalej, badacze zauważają, że LLM’ów tendencja do wahania między faktualną dokładnością a subiektywnymi przypuszczeniami jest bardzo ludzką cechą, i jedną udokumentowaną przez różne naukowe badania*:

‘[LLM’ów wiedza] jest nierównomiernie niezawodna: niektóre stwierdzenia są silnie wspierane, podczas gdy inne są spekulatywne, przestarzałe lub niepewne. Generowanie wymaga decyzji, ile powiedzieć i jak ostrożnie to powiedzieć, tworząc napięcie między faktualną precyzją a informatywnością.

‘Ludzie podejmują analogiczne wybory: zaczynając od faktów o wysokiej wiarygodności i dodając niższej pewności szczegóły tylko wtedy, gdy są o to pytani.’

Chociaż eksperymenty zostały przeprowadzone tylko na modelu Mistral, zasady, które zostały zastosowane, powinny działać na różnych skalach i platformach, ponieważ obejmują one nową kwantyfikację danych, jako dodatek do wewnętrznego schematu LLM; i poprawkę tego rodzaju nie jest architektura-specyficzna.

Artykuł nowy nosi tytuł Factuality on Demand: Controlling the Factuality-Informativeness Trade-off in Text Generation, i pochodzi od siedmiu badaczy z Columbia University, New York University i NYU Shanghai.

Metoda i dane

Nowy podejście przedstawione w artykule nazywa się Factuality-Controlled Generation (FCG), i wprowadza wirtualny “przełącznik”, który pozwala użytkownikom określić, jak dokładna ma być odpowiedź bota. ‘W istocie,’ artykuł stwierdza, ‘FCG poprawia model z kontrolowanym “przełącznikiem” dla faktualności’.

Model przyjmuje zarówno pytanie użytkownika, jak i pożądany poziom faktualności, a następnie generuje odpowiedź, która zawiera tylko informacje, które uważa za wystarczająco wiarygodne, przy jednoczesnym staraniu się o to, aby być jak najbardziej szczegółowym w ramach tego ograniczenia.

Wykorzystując (powyższy) system FactScore, wyjściowy podział z próbek zapytań jest oceniany pod kątem dokładności, jakości określanej jako przestrzeganie faktualności:

Potok danych szkoleniowych dla FCG: model językowy generuje początkową odpowiedź, dzieli ją na atomowe fakty, ocenia je według pewności i odrzuca najmniej wiarygodne, aż do osiągnięcia pożądanego poziomu prawdy. Źródło - https://arxiv.org/pdf/2602.00848

Potok danych szkoleniowych dla FCG: model językowy generuje początkową odpowiedź, dzieli ją na atomowe fakty, ocenia je według pewności i odrzuca najmniej wiarygodne, aż do osiągnięcia pożądanego poziomu prawdy. Źródło

Ponieważ nie istniał żaden istniejący zestaw danych, który odpowiadałby wymaganiom FCG, autorzy stworzyli syntetyczny zestaw danych, wykorzystując model językowy GPT-4 do wygenerowania nieograniczonej odpowiedzi, a następnie usunięcie “najmniej wiarygodnych” faktów, aż odpowiedź spełniła określony poziom dokładności.

Poprzednie badania sugerowały, że szkolenie tylko na danych rzeczywistych mogło uczynić modele mniej faktualnymi, poprzez zniechęcanie ich do podawania jakichkolwiek dodatkowych szczegółów. Dlatego przykłady szkoleniowe FCG były minimalnie edytowane, zachowując własne sformułowania i rytm modelu, przy jednoczesnym usunięciu tylko tyle, aby spełnić wymagany cel pewności.

Poprzez zastosowanie tego procesu edycyjnego w zakresie różnych poziomów pewności, od 10% do surowego progu 100%, stworzono syntetyczny zestaw danych, w którym każde pytanie było sparowane z wieloma przefiltrowanymi odpowiedziami.

W każdej wersji zachowano tylko te fakty, które model uznał za wystarczająco wiarygodne, aby spełnić żądany poziom faktualności; te przykłady zostały następnie wykorzystane jako dane szkoleniowe do nadzorowanego doskonalenia.

Ostateczny zestaw danych składał się z 3 302 (pytanie, kontrola, odpowiedź) potrójnych dla szkolenia i 396 dla walidacji, zbudowanych z 500 jednostek podzielonych na 450 do szkolenia i 50 do rozwoju. Dodatkowe 183 odrębne jednostki zostały wykorzystane do testowania.

Szkolenie i testy

Autorzy doskonalili model Mistral-7B-Instruct-v0.2 LLM przy różnych stawkach uczenia (3e-6, 1e-5, 3e-5) w celu uzyskania optymalnego (nieujawnionego) LR, przez 30 epok, przy rozmiarze partii 256 (n.b. sprzęt szkoleniowy nie jest określony).

FCG został przetestowany wobec dwóch punktów odniesienia. Pierwszym było Brak kontroli faktualności (NFC), gdzie model został po prostu sprowokowany prośbą, taką jak Powiedz mi o bio X, bez żadnej wzmianki o dokładności lub pewności. Ta wersja odzwierciedla domyślne zachowanie LLM, bez żadnego mechanizmu do filtrowania lub ograniczania.

Druga metoda, nazwana Kontrolowaną inferencją faktualności (FCI), wykorzystywała te same podpowiedzi poziomu pewności bez żadnego doskonalenia. Na przykład, model mógł być sprowokowany ‘Podaj informacje, które uważasz za 90% pewne’. W tym przypadku instrukcja przypominała te, które zostały wykorzystane w szkoleniu, ale model nie miał wcześniej żadnego kontaktu z takimi ograniczeniami:

Porównanie trzech testowanych podejść: punktu odniesienia z brakiem kontroli; wersji z podpowiedziami faktualności bez szkolenia; i w pełni wyszkolonego modelu, który nauczył się dostosowywać do ustawień dokładności poprzez narażenie na przefiltrowane dane.

Porównanie trzech testowanych podejść: punktu odniesienia z brakiem kontroli; wersji z podpowiedziami faktualności bez szkolenia; i w pełni wyszkolonego modelu, który nauczył się dostosowywać do ustawień dokładności poprzez narażenie na przefiltrowane dane.

Początkowo przeprowadzono test przestrzegania faktualności:

Wyniki dla trzech poziomów pewności. Tylko w pełni wyszkolony model był w stanie wyprodukować w pełni faktualne dane wyjściowe, i przewyższył oba punkty odniesienia we wszystkich aspektach, szczególnie na wyższych progach.

Wyniki dla trzech poziomów pewności. Tylko w pełni wyszkolony model był w stanie wyprodukować w pełni faktualne dane wyjściowe, i przewyższył oba punkty odniesienia we wszystkich aspektach, szczególnie na wyższych progach.

Gdy przetestowano go wobec progów pewności 80%, 90% i 100%, tylko w pełni wyszkolony model był w stanie konsekwentnie spełniać cele. Zaskakująco, proste dodanie instrukcji pewności, bez szkolenia modelu do ich przestrzegania, nie pomogło. W niektórych przypadkach to pogorszyło sytuację; na przykład, tylko 3,8% danych wyjściowych z modelu z podpowiedziami spełniło próg 90%, w porównaniu z 5,5% z wersji bez instrukcji w ogóle:

To sugeruje, twierdzą autorzy, że model Mistral-7B nie był w stanie interpretować podpowiedzi, takich jak ‘bądź 90% pewny’, w sposób użyteczny, i że dodatkowa instrukcja mogła nawet zakłócić jego zwykłe dane wyjściowe.

Przeciwnie, wyszkolony model reagował w sposób niezawodny na sygnały sterujące, produkując 18,7% zgodnych danych wyjściowych na poziomie 80%, 12,6% na poziomie 90%, i 23,6% na poziomie 100%; i okazał się jedyną metodą, która mogła wyprodukować pełnie faktualne odpowiedzi:

‘Te poprawki wskazują, że zdolność do kontrolowania faktualności może być rzeczywiście wpajana za pomocą nadzorowanego szkolenia. Model FCG nauczył się dostosowywać swoją treść i zawierać tylko fakty, w których jest wystarczająco pewny, podczas gdy model z półki nie mógł skutecznie wykorzystać sygnału sterującego samodzielnie.’

W oddzielnym teście, zaprojektowanym w celu potwierdzenia, że model rzeczywiście nauczył się interpretować sygnał sterujący, badacze sprawdzili, czy średnia faktualność odpowiedzi rosła wraz ze wzrostem poziomów prawdy.

Żaden taki wzorzec nie pojawił się przed szkoleniem, ale po nim wyniki ujawniły stabilny wzrost tendencji, z wyższymi poziomami pewności produkującymi coraz bardziej dokładne odpowiedzi:

Wraz ze wzrostem poziomu prawdy, model FCG produkował coraz bardziej faktualne dane wyjściowe w odpowiedzi, przy czym modele odniesienia nie wykazywały żadnej stabilnej zmiany w tym samym zakresie.

Wraz ze wzrostem poziomu prawdy, model FCG produkował coraz bardziej faktualne dane wyjściowe w odpowiedzi, przy czym modele odniesienia nie wykazywały żadnej stabilnej zmiany w tym samym zakresie.

Kompromis między prawdą a “bogactwem” również został zbadany. Dane wyjściowe zostały ocenione nie tylko pod kątem dokładności, ale także pod kątem ilości zwalidowanych informacji, które pozostały pod coraz bardziej surowymi wymogami faktualności. Jak widać na poniższym wykresie, model FCG okazał się lepszy od obu modeli odniesienia na większości poziomów:

Wykres reprezentujący kompromis między faktualnością a bogactwem dla trzech metod. Model FCG okazał się lepszy w balansowaniu między prawdą a szczegółowością niż oba modele odniesienia. Na porównywalnych poziomach dokładności, więcej faktualnej treści zostało zachowane, a na najwyższym poziomie pozostał jedyną metodą, która mogła wyprodukować w pełni zwalidowane dane wyjściowe, które nie były puste.

Wykres reprezentujący kompromis między faktualnością a bogactwem dla trzech metod. Model FCG okazał się lepszy w balansowaniu między prawdą a szczegółowością niż oba modele odniesienia. Na porównywalnych poziomach dokładności, więcej faktualnej treści zostało zachowane, a na najwyższym poziomie pozostał jedyną metodą, która mogła wyprodukować w pełni zwalidowane dane wyjściowe, które nie były puste.

Na poziomie dokładności około 90%, więcej faktów zostało zachowanych przez FCG niż przez jakąkolwiek inną metodę, a w całym zakresie ustawień nie było żadnego modelu odniesienia, który produkowałby konsekwentnie lepsze wyniki.

Różnica była najbardziej widoczna na najbardziej surowym poziomie, gdzie FCG nadal produkował niezerową bogactwo, podczas gdy model odniesienia z podpowiedziami został zmuszony do usunięcia wszystkiego. W tych przypadkach nawet jeden niski poziom pewności spowodowałby odrzucenie całej odpowiedzi.

Przeciwnie, wyszkolony model był w stanie przekształcić swoje dane wyjściowe, aby zachować tylko fakty, które uważał za w pełni wiarygodne, unikając załamania się w milczeniu, które dotknęło inne.

Faktualność była bezpośrednio ograniczona przez ustawienie sterujące, podczas gdy bogactwo było optymalizowane przez pozwolenie modelowi na zawarcie jak najwięcej wiarygodnych treści. Na wyższych poziomach tylko zaufane stwierdzenia były zachowane; na niższych poziomach więcej spekulatywnych szczegółów było dozwolonych, zwiększając długość, ale redukując dokładność.

Autorzy kończą:

‘[Gdy] wysoki poziom faktualności jest nałożony, model priorytetowo traktuje zwalidowane stwierdzenia, jednocześnie zawierając jak najwięcej istotnych informacji. Odwrotnie, model ma swobodę włączenia szerszego zakresu szczegółów, w tym tych, które są mniej zwalidowane lub bardziej spekulatywne, co skutkuje wyższym bogactwem (więcej faktów wymienionych) kosztem pewnej dokładności.

‘To zachowanie jest zgodne z naszym projektem danych szkoleniowych: ponieważ zawsze usuwaliśmy minimalną niezbędną ilość faktów, model nauczył się “jeśli musisz być x% faktualny, odrzuć najmniej pewne szczegóły, ale zachowaj wszystko inne.” ‘

Artykuł kończy się nadzieją, że nowa metoda zostanie wypróbowana z większymi modelami i zastosowana do bardziej złożonych zadań, wśród innych możliwych przyszłych rozszerzeń pracy.

Wnioski

Rozwiązanie przedstawione tutaj rozwiązuje jeden z najbardziej poważnych i często zauważanych błędów nawet najnowszej generacji Large Language Models – ich tendencję do faworyzowania gadatliwości nad dokładnością, wydaje się, aby “utrzymać rozmowę” i przedstawić z pewnością nieaktualne lub w pełni halucynacyjne informacje jako faktualne.

Dla użytkowników ChatGPT, każda pewna odpowiedź, która nie jest poprzedzona krótkim pojawieniem się “szukania w sieci”, pochodzi albo z granic modelu daty granicznej wiedzy, albo może być halucynacją.

Jednak wyszukiwania w sieci zwiększają opóźnienia i koszty działania LLM, i, jak każdy użytkownik wie, są wykonywane selektywnie; albo na żądanie użytkownika; albo jako “specjalna opcja”, która może wiązać się z dodatkowymi opłatami za tokeny.

Niemniej jednak, tego rodzaju wewnętrzna ekonomia może mieć krytyczny wpływ na zapytania LLM w określonych dziedzinach, lub dla określonych typów zapytań. Każda metoda, która może nałożyć schemat związany z dokładnością danych wyjściowych, jest mile widziana jako badanie.

 

* Moja konwersja cytowań autorów do linków.

Pełna wersja nie została podana.

Opublikowane po raz pierwszy w piątek, 6 lutego 2026. Zmienione w ciągu pięciu minut dla powtarzającego się słowa

Pisarz na temat uczenia maszynowego, specjalista w dziedzinie syntezy obrazu ludzkiego. Były kierownik treści badawczych w Metaphysic.ai, do czasu jego rozwiązania w DNEG's Brahma.ai.
Strona portfelowo: martinanderson.ai
Kontakt: [email protected]