KÄ t Andersona
Walka z cheatingiem AI w testach

Ostatnie wyniki badaÅ z chiÅskiego uniwersytetu dostarczajÄ wglÄ du w to, dlaczego generatywne modele przetwarzania jÄzyka naturalnego, takie jak GPT-3, majÄ tendencjÄ do âoszukiwaniaâ, gdy zadaje siÄ im trudne pytanie, produkujÄ c odpowiedzi, ktÃģre mogÄ byÄ technicznie poprawne, ale bez prawdziwego zrozumienia, dlaczego odpowiedÅš jest poprawna; oraz dlaczego wykazujÄ one niewielkÄ lub ÅžadnÄ zdolnoÅÄ do wyjaÅnienia logiki za ich âÅatwymiâ odpowiedziami. Badacze proponujÄ rÃģwnieÅž nowe metody, aby sprawiÄ, by systemy âuczyÅy siÄ ciÄÅžejâ podczas fazy szkolenia.
Problem jest podwÃģjny: po pierwsze, projektujemy systemy, ktÃģre starajÄ siÄ osiÄ gnÄ Ä wyniki szybko i z optymalnym wykorzystaniem zasobÃģw. Nawet w przypadku, gdy jak w przypadku GPT-3, zasoby mogÄ byÄ znacznie wiÄksze niÅž te, ktÃģrymi dysponuje przeciÄtny projekt badawczy z dziedziny NLP, kultura wynikÃģw napÄdzanych optymalizacjÄ nadal dominuje w metodologii, poniewaÅž staÅa siÄ konwencjÄ akademickÄ .
W zwiÄ zku z tym nasze architektury szkoleniowe nagradzajÄ modele, ktÃģre szybko siÄ zbiegajÄ i produkujÄ pozornie odpowiednie odpowiedzi na pytania, nawet jeÅli model NLP nie jest w stanie pÃģÅšniej uzasadniÄ swojej odpowiedzi lub wykazaÄ, w jaki sposÃģb doszedÅ do swoich wnioskÃģw.
Wczesna skÅonnoÅÄ do oszukiwania
Zjawisko to wystÄpuje, poniewaÅž model uczy siÄ âodpowiedzi skrÃģconychâ znacznie wczeÅniej w trakcie szkolenia niÅž uczy siÄ bardziej skomplikowanych typÃģw zdobywania wiedzy. PoniewaÅž zwiÄkszona dokÅadnoÅÄ jest czÄsto nagradzana doÅÄ swobodnie w trakcie szkolenia, model nastÄpnie priorytetowo traktuje kaÅžde podejÅcie, ktÃģre pozwoli mu odpowiedzieÄ na pytanie âgÅadkoâ i bez prawdziwej wiedzy.
PoniewaÅž uczenie siÄ skrÃģconych odpowiedzi bÄdzie nieuchronnie reprezentowaÅo pierwsze sukcesy w trakcie szkolenia, sesja bÄdzie naturalnie tendowaÄ w stronÄ odejÅcia od trudniejszego zadania zdobycia uÅžytecznej i bardziej kompletnego perspektywy epistemologicznej, ktÃģra moÅže zawieraÄ gÅÄbsze i bardziej przekonywujÄ ce warstwy atrybucji i logiki.
Karmienie AI âÅatwymiâ odpowiedziami
Drugim problemem jest to, Åže nawet jeÅli ostatnie inicjatywy badawcze zbadano tendencjÄ AI do âoszukiwaniaâ w ten sposÃģb i zidentyfikowano zjawisko âskrÃģtÃģwâ, nie byÅo dotÄ d Åžadnych wysiÅkÃģw, aby sklasyfikowaÄ materiaÅ âumoÅžliwiajÄ cy skrÃģtyâ w danych przyczyniajÄ cych siÄ, co byÅoby logicznym pierwszym krokiem w rozwiÄ zaniu, co moÅže okazaÄ siÄ podstawowÄ wadÄ architektonicznÄ systemÃģw MRC (Machine Reading Comprehension).
Nowy artykuÅ, bÄdÄ cy wspÃģÅpracÄ miÄdzy Instytutem Technologii Komputerowej Wangxuan i Laboratorium Komputacyjnej Lingwistyki MOE na Uniwersytecie PekiÅskim, testuje rÃģÅžne modele jÄzykowe na nowo opatrzonych adnotacjach, ktÃģre zawierajÄ klasyfikacje dla âÅatwychâ i âtrudnychâ rozwiÄ zaÅ moÅžliwego pytania.

ÅđrÃģdÅo: https://arxiv.org/pdf/2106.01024.pdf
Zestaw danych wykorzystuje przeksztaÅcanie jako kryterium bardziej skomplikowanych i gÅÄbokich odpowiedzi, poniewaÅž konieczne jest zrozumienie semantyczne, aby sformuÅowaÄ pozyskanÄ wiedzÄ. W przeciwieÅstwie do tego, âskrÃģconeâ odpowiedzi mogÄ wykorzystywaÄ tokeny, takie jak daty i inne sÅowa-klucze, aby wyprodukowaÄ odpowiedÅš, ktÃģra jest faktograficznie poprawna, ale bez kontekstu ani uzasadnienia.
SkÅadnik skrÃģcony w adnotacjach obejmuje dopasowanie sÅÃģw pytaÅ (QWM) i proste dopasowanie (SpM). Dla QWM model wykorzystuje encje wyodrÄbnione z dostarczonych danych tekstowych i odrzuca kontekst; dla SpM model identyfikuje nakÅadanie siÄ miÄdzy zdania odpowiedzi a pytaniami, oba dostarczane w danych szkoleniowych.
Dane skrÃģcone prawie âwirusoweâ w wpÅywie na zestaw danych
Badacze twierdzÄ , Åže zestawy danych majÄ tendencjÄ do zawierania wysokiego odsetka pytaÅ skrÃģconych, co powoduje, Åže wyszkolone modele opierajÄ siÄ na skrÃģconych sztuczkach.
Dwa modele wykorzystane w eksperymentach to BiDAF i BERT-base. Badacze obserwujÄ , Åže nawet gdy sÄ szkolone na wariacjach zestawu danych z wyÅžszym odsetkiem âtrudnychâ pytaÅ, oba modele nadal radzÄ sobie lepiej ze skrÃģconymi pytaniami niÅž z trudniejszymi zapytaniami sformuÅowanymi w inny sposÃģb, pomimo niewielkiej liczby przykÅadÃģw w zestawie danych.
To przedstawia âdane skrÃģconeâ niemal w kontekÅcie wirusa â aby musiaÅo byÄ bardzo niewiele z nich obecnych w zestawie danych, aby zostaÅy przyjÄte i priorytetowo traktowane w trakcie szkolenia, zgodnie z konwencjonalnymi standardami i praktykami w NLP.
DowÃģd oszukiwania
JednÄ z metod, ktÃģre badanie wykorzystuje do udowodnienia, jak krucha jest odpowiedÅš skrÃģcona, jest zastÄ pienie âÅatwegoâ sÅowa encji anomaliÄ . Gdy wykorzystano metodÄ skrÃģconÄ , logika âoszukanejâ odpowiedzi nie moÅže byÄ dostarczona; ale gdy odpowiedÅš zostaÅa dostarczona z gÅÄbszego kontekstu i semantycznej oceny szerszego zakresu przyczyniajÄ cych siÄ tekstÃģw, moÅžliwe jest dla systemu rozÅoÅženie bÅÄdu i odbudowanie poprawnej odpowiedzi.

ZastÄ pienie âBeyoncÃĐâ (osoba) przez âAmerykÄâ (lokalizacja) ujawnia, czy model ma jakÄ Å tÅo logiczne dla swojej odpowiedzi.
SkrÃģty ze wzglÄdu na imperatyw ekonomiczny
Co siÄ tyczy niektÃģrych powodÃģw architektonicznych, dla ktÃģrych skrÃģty sÄ tak priorytetowe w przepÅywach pracy NLP, autorzy komentujÄ âModele MRC mogÄ nauczyÄ siÄ sztuczek skrÃģconych, takich jak QWM, z mniejszymi zasobami obliczeniowymi niÅž wyzwania zwiÄ zane z zrozumieniem, takie jak identyfikacja przeksztaÅceÅâ.
To mogÅoby byÄ niezamierzonym wynikiem standardowych filozofii optymalizacji i oszczÄdnoÅci zasobÃģw w podejÅciach do machine reading comprehension, oraz presji, aby uzyskaÄ wyniki z ograniczonymi zasobami w krÃģtkich ramach czasowych.
Badacze zauwaÅžajÄ rÃģwnieÅž:
â[PoniewaÅž] sztuczka skrÃģcona moÅže byÄ wykorzystana do odpowiedzi na wiÄkszoÅÄ pytaÅ szkoleniowych poprawnie, ograniczona liczba nierozwiÄ zanych pytaÅ, ktÃģre pozostajÄ , moÅže nie motywowaÄ modeli do eksplorowania bardziej zaawansowanych rozwiÄ zaÅ, ktÃģre wymagajÄ wyzwania.â
JeÅli wyniki artykuÅu zostanÄ potwierdzone, wydaje siÄ, Åže ogromny i stale rosnÄ cy obszar przetwarzania danych moÅže musieÄ rozwaÅžyÄ âukryte podrÄcznikiâ w danych jako problem do rozwiÄ zania w dÅugiej perspektywie, lub zmieniÄ architektury NLP, aby priorytetowo traktowaÄ bardziej wymagajÄ ce rutyny dla spoÅžycia danych.












