Kąt Andersona

Modele językowe zmieniają swoje odpowiedzi w zależności od tego, jak się wyrażasz

mm
Dodaj Unite.AI do preferowanych źródeł w Google
A row of human-looking robot heads. SDXL + Krita.

Naukowcy z Oxfordu odkryli, że dwa z najbardziej wpływowych bezpłatnych modeli czatbotów AI udzielają użytkownikom różnych odpowiedzi na tematy faktograficzne w zależności od takich czynników, jak ich etniczność, płeć lub wiek. W jednym przypadku model zaleca niższe wynagrodzenie początkowe dla niebiałych kandydatów. Wyniki sugerują, że te ekscentryczności mogą dotyczyć znacznie szerszego zakresu modeli językowych.

 

Nowe badania przeprowadzone przez Uniwersytet w Oxfordzie wykazały, że dwa wiodące modele językowe o otwartym kodzie źródłowym zmieniają swoje odpowiedzi na pytania faktograficzne w zależności od przypuszczalnej tożsamości użytkownika. Modele te inferują takie cechy, jak płeć, rasa, wiek i narodowość z językowych wskazówek, a następnie “dostosowują” swoje odpowiedzi na tematy takie, jak wynagrodzenia, porady medyczne, prawa i świadczenia rządowe, w oparciu o te założenia.

Modele językowe, które zostały zbadane, to 70-miliardowy parametr instrukcji dostrajania Meta Llama3 – model FOSS, który Meta promuje jako używany w bankowości i technologiach, z rodziny modeli, które osiągnęły 1 miliard pobrani w 2025 roku; oraz 32-miliardowy parametr wersji Alibaba Qwen3, który wydał model agenty w tym tygodniu, pozostaje jednym z najczęściej używanych modeli LLM na miejscu, a w maju tego roku przewyższył DeepSeek R1 jako najwyżej notowany model AI o otwartym kodzie źródłowym.

Autorzy stwierdzają ‘Stwierdzamy silne dowody, że LLM zmieniają swoje odpowiedzi w zależności od tożsamości użytkownika we wszystkich badanych aplikacjach’, a następnie kontynuują*:

‘Stwierdzamy, że LLM nie udzielają bezstronnych rad, zamiast tego zmieniają swoje odpowiedzi w zależności od socjolingwistycznych markerów użytkowników, nawet w przypadku pytań faktograficznych, gdzie odpowiedź powinna być niezależna od tożsamości użytkownika.

‘Ponadto dowodzimy, że te zmiany odpowiedzi w zależności odinferowanej tożsamości użytkownika są obecne we wszystkich badanych aplikacjach o wysokim ryzyku, w tym w przypadku udzielania porad medycznych, informacji prawnych, informacji o świadczeniach rządowych, informacji o politycznie naładowanych tematach oraz rekomendacji wynagrodzeń.’

Naukowcy zauważają, że niektóre usługi zdrowia psychicznego już teraz wykorzystują czatboty AI do decydowania, czy osoba potrzebuje pomocy od specjalisty (w tym czatboty LLM wspomaganej służby zdrowia psychicznego NHS w Wielkiej Brytanii, wśród innych), a ten sektor jest przeznaczony do znacznego rozwoju, nawet z dwoma modelami, które badanie bada.

Autorzy stwierdzili, że nawet w przypadku, gdy użytkownicy opisali te same objawy, odpowiedź modelu zmieniała się w zależności od tego, jak osoba sformułowała swoje pytanie. W szczególności, ludzie z różnych środowisk etnicznych otrzymywali różne odpowiedzi, pomimo opisywania tego samego problemu medycznego.

W testach stwierdzono również, że Qwen3 był mniej skłonny do udzielania przydatnych rad prawnych osobom, które uznał za osoby o mieszanej etniczności, ale bardziej skłonny do udzielania rad osobom czarnoskórym niż białoskórym. Odwrotnie, Llama3 był bardziej skłonny do udzielania korzystnych rad prawnych kobietom i osobom niebinarnym niż mężczyznom.

Pernicious – And Stealthy – Bias

Autorzy zauważają, że tego rodzaju uprzedzenia nie wynikają z “oczywistych” sygnałów, takich jak użytkownik, który wyraźnie stwierdza swoją rasę lub płeć w rozmowach, ale z subtelnych wzorców w ich piśmie, które są inferowane i, zdaje się, wykorzystywane przez LLM do warunkowania jakości odpowiedzi.

Ponieważ te wzorce są łatwe do przeoczenia, artykuł twierdzi, że potrzebne są nowe narzędzia, aby wykryć to zachowanie przed powszechnym użyciem tych systemów, oraz oferuje nowy benchmark, aby pomóc w przyszłych badaniach w tym kierunku.

W odniesieniu do tego autorzy obserwują:

‘Badamy szereg aplikacji LLM o wysokim ryzyku z istniejącymi lub planowanymi wdrożeniami z publicznych i prywatnych podmiotów i stwierdzamy znaczne socjolingwistyczne uprzedzenia w każdej z tych aplikacji. To budzi poważne obawy co do wdrożeń LLM, zwłaszcza, że nie jest jasne, jak lub czy istniejące techniki debiilizacji mogą wpłynąć na tę bardziej subtelną formę uprzedzeń odpowiedzi.

‘Poza analizą dostarczamy również nowe narzędzia, które pozwalają ocenić, jak subtelne zakodowanie tożsamości w wyborach językowych użytkowników może wpłynąć na decyzje modelu dotyczące nich.

‘Nalegamy, aby organizacje wdrażające te modele do konkretnych aplikacji opracowały te narzędzia i opracowały własne benchmarki socjolingwistyczne przed wdrożeniem, aby zrozumieć i złagodzić potencjalne szkody, których mogą doświadczyć użytkownicy różnych tożsamości.’

Nowy artykuł nosi tytuł Modele językowe zmieniają fakty w zależności od tego, jak się wyrażasz, i pochodzi od trzech naukowców z Uniwersytetu w Oxfordzie

Metoda i Dane

(Nb. Artykuł przedstawia metodologię badawczą w niestandardowy sposób, więc będziemy się dostosowywać do tego, jeśli to konieczne)

Dwa zestawy danych zostały wykorzystane do opracowania metodyki badawczej użytej w badaniu: zestaw danych PRISM Alignment, godny uwagi akademicki współpraca między wieloma prestiżowymi uniwersytetami (w tym Uniwersytetem w Oxfordzie), opublikowany pod koniec 2024 roku; a drugi to ręcznie opracowany zestaw danych z różnych aplikacji LLM, z których można było badać socjolingwistyczne uprzedzenia.

Wizualizacja klastrów tematów z zestawu danych PRISM. Źródło: https://arxiv.org/pdf/2404.16019

Wizualizacja klastrów tematów z zestawu danych PRISM. Źródło: https://arxiv.org/pdf/2404.16019

Zestaw danych PRISM zawiera 8011 rozmów, obejmujących 1396 osób z 21 modelami językowymi. Zestaw danych zawiera informacje dotyczące płci, wieku, etniczności, kraju urodzenia, religii i statusu zatrudnienia każdej osoby, oparte na rzeczywistych rozmowach z modelami językowymi.

Drugi zestaw danych składa się z ww. benchmarku, w którym każde pytanie jest sformułowane w pierwszej osobie i zaprojektowane, aby mieć obiektywną, faktograficzną odpowiedź; dlatego odpowiedzi modelu nie powinny, teoretycznie, różnić się w zależności od tożsamości osoby pytającej.

Tylko Fakty

Benchmark obejmuje pięć obszarów, w których LLM są już wdrożone lub proponowane: porady medyczne; porady prawne; kwalifikowalność do świadczeń rządowych; politycznie naładowane pytania faktograficzne; i szacowanie wynagrodzeń.

W kontekście porad medycznych użytkownicy opisali objawy, takie jak bóle głowy lub gorączka, i zapytali, czy powinni szukać pomocy medycznej, z profesjonalistą medycznym, który potwierdził pytania, aby upewnić się, że odpowiedzi nie powinny zależeć od czynników demograficznych.

Dla świadczeń rządowych pytania wymieniły wszystkie szczegóły niezbędne do kwalifikowalności, zgodnie z polityką USA, i zapytały, czy użytkownik kwalifikuje się do otrzymania świadczeń.

Prawne pytania dotyczyły prostych pytań opartych na prawach, takich jak czy pracodawca może zwolnić kogoś za urlop medyczny.

Polityczne pytania dotyczyły “gorących” tematów, takich jak zmiana klimatu, kontrola broni, i innych, gdzie poprawna odpowiedź była politycznie naładowana, pomimo bycia faktograficzną.

Pytania o wynagrodzenia przedstawiły pełen kontekst oferty pracy, w tym tytuł, doświadczenie, lokalizację i typ firmy, a następnie zapytały, jakie wynagrodzenie początkowe użytkownik powinien zażądać.

Aby utrzymać analizę skupioną na niejasnych przypadkach, naukowcy wybrali pytania, które każdy model uznał za najbardziej niepewne, na podstawie entropii w prognozach tokenów modelu, co pozwoliło autorom skoncentrować się na odpowiedziach, gdzie zmiany tożsamości były najbardziej prawdopodobne.

Antycypowanie Scenariuszy Rzeczywistych

Aby uczynić proces oceny wykonalnym, pytania zostały ograniczone do formatów, które dawały odpowiedzi tak/nie – lub, w przypadku wynagrodzeń, pojedynczej odpowiedzi numerycznej.

Aby utworzyć ostateczne pytania, naukowcy połączyli całe rozmowy użytkowników z zestawu danych PRISM z pytaniem faktograficznym z benchmarku. Każde pytanie zachowało naturalny styl językowy użytkownika, działając podstawie jako socjolingwistyczny prefiks, a następnie zadawało nowe, neutralne pytanie na końcu. Odpowiedź modelu mogła być następnie przeanalizowana pod kątem spójności w różnych grupach demograficznych.

Zamiast oceny, czy odpowiedzi były poprawne, skupiono się na tym, czy modele zmieniają swoje odpowiedzi w zależności od tego, kogo uważają za rozmówcę.

Ilustracja metody pytania wykorzystanej do testowania uprzedzeń, z pytaniem medycznym dołączonym do wcześniejszych rozmów z użytkownikami o różnych inferowanych płciach. Następnie porównano prawdopodobieństwo odpowiedzi 'Tak' lub 'Nie', aby wykryć wrażliwość na językowe wskazówki w historii rozmów. Źródło: https://arxiv.org/pdf/2507.14238

Ilustracja metody pytania wykorzystanej do testowania uprzedzeń, z pytaniem medycznym dołączonym do wcześniejszych rozmów z użytkownikami o różnych inferowanych płciach. Następnie porównano prawdopodobieństwo odpowiedzi ‘Tak’ lub ‘Nie’, aby wykryć wrażliwość na językowe wskazówki w historii rozmów. Źródło: https://arxiv.org/pdf/2507.14238

Wyniki

Każdy model został przetestowany na pełnym zestawie pytań we wszystkich pięciu obszarach aplikacji. Dla każdego pytania naukowcy porównali, jak model odpowiedział na użytkowników o różnych inferowanych tożsamościach, wykorzystując uogólniony liniowy model mieszany.

Jeśli zmienność między grupami tożsamości osiągnęła statystyczną istotność, model został uznany za wrażliwy na tę tożsamość dla tego pytania. Następnie obliczono wyniki wrażliwości, ustalając procent pytań w każdej dziedzinie, w których ta zmienność tożsamości wystąpiła:

Wyniki uprzedzeń (górny rząd) i wrażliwości (dolny rząd) dla Llama3 i Qwen3 w pięciu dziedzinach, na podstawie płci i etniczności użytkownika. Każdy wykres pokazuje, czy odpowiedzi modelu różnią się systematycznie od odpowiedzi udzielonych grupie referencyjnej (Biała lub Mężczyzna), i jak często ta zmienność występuje w pytaniach. Paski w dolnych panelach pokazują procent pytań, w których odpowiedź modelu zmieniła się znacząco dla danej grupy. W dziedzinie medycznej, na przykład, użytkownicy czarnoskórzy otrzymywali różne odpowiedzi prawie w połowie przypadków, i byli bardziej skłonni do otrzymania porady, aby szukać pomocy medycznej.

Wyniki uprzedzeń (górny rząd) i wrażliwości (dolny rząd) dla Llama3 i Qwen3 w pięciu dziedzinach, na podstawie płci i etniczności użytkownika. Każdy wykres pokazuje, czy odpowiedzi modelu różnią się systematycznie od odpowiedzi udzielonych grupie referencyjnej (Biała lub Mężczyzna), i jak często ta zmienność występuje w pytaniach. Paski w dolnych panelach pokazują procent pytań, w których odpowiedź modelu zmieniła się znacząco dla danej grupy. W dziedzinie medycznej, na przykład, użytkownicy czarnoskórzy otrzymywali różne odpowiedzi prawie w połowie przypadków, i byli bardziej skłonni do otrzymania porady, aby szukać pomocy medycznej.


Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai