Prompt engineering

ChatGPT i zaawansowane inżynieria promptów: napędzanie ewolucji AI

mm
Dodaj Unite.AI do preferowanych źródeł w Google

OpenAI odegrało znaczącą rolę w tworzeniu rewolucyjnych narzędzi, takich jak OpenAI Gym, przeznaczonych do szkolenia algorytmów wzmocnienia, oraz modeli GPT-n. W centrum uwagi znajduje się również DALL-E, model AI, który tworzy obrazy na podstawie danych wejściowych. Jednym z takich modeli, który przyciągnął znaczącą uwagę, jest ChatGPT OpenAI, wybitny przykład w dziedzinie dużych modeli językowych.

GPT-4: Inżynieria promptów

ChatGPT przekształcił krajobraz czatbotów, oferując odpowiedzi podobne do ludzkich na dane wejściowe użytkownika i rozszerzając swoje zastosowania w różnych dziedzinach – od rozwoju oprogramowania i testowania do komunikacji biznesowej, a nawet tworzenia poezji.

W rękach firm i osób, GPT-4, na przykład, mógłby służyć jako niezwykle bogate źródło wiedzy, biegłe w przedmiotach od matematyki i biologii po studia prawnicze. Taki zaawansowany i dostępny model AI jest zdolny do przedefiniowania przyszłości pracy, nauki i kreatywności.

ChatGPT Futurystyczne logo

Modele generatywne, takie jak GPT-4, mogą generować nowe dane na podstawie istniejących danych wejściowych. Ta wyróżniająca cecha pozwala im na wykonywanie różnorodnych zadań, w tym generowania tekstu, obrazów, muzyki i wideo.

W kontekście ChatGPT i modeli OpenAI, prompt jest danymi wejściowymi, które użytkownicy dostarczają modelom, zwykle w postaci tekstu. Prompty służą jako podstawowy środek kontroli wyjścia generowanego przez te modele, co sprawia, że są one niezwykle ważne dla udanego i istotnego dialogu.

Wpływ jakości promptu

Używanie dobrze zdefiniowanych promptów jest kluczem do prowadzenia użytecznych i znaczących rozmów z systemami AI. Słabo zdefiniowane prompty mogą skutkować wyjściem, które nie jest pomocne dla użytkownika i może nawet prowadzić do mylących treści.

Aby zademonstrować wpływ jakości promptu, porównajmy dwa różne prompty podane ChatGPT. Pierwszy prompt, słabo zdefiniowany i zakładający wiedzę wstępną, generuje potencjalnie nieprzydatną odpowiedź dla użytkownika. Z drugiej strony, drugi prompt dostarcza więcej kontekstu i przykładów, zapewniając bardziej istotną i zrozumiałą odpowiedź.

Prompt 1: “Opowiedz mi o sieciach neuronowych z wykorzystaniem splotu.”

Odpowiedź 1: “Sieci neuronowe z wykorzystaniem splotu (CNN) to wielowarstwowe sieci perceptronowe, które składają się z warstw całkowicie połączonych i warstw pulowania. Są one powszechnie stosowane w zadaniach rozpoznawania obrazów. Proces obejmuje stosowanie filtrów do obrazów wejściowych i ich skalowanie przy użyciu warstw pulowania.”

Prompt 2: “Chcę dowiedzieć się o sieciach neuronowych z wykorzystaniem splotu, ale nie mam wiedzy wstępnej o sztucznych sieciach neuronowych. Czy możesz podać przyjazną dla początkujących wyjaśnienie i przykład, jak sieci te są stosowane w rozpoznawaniu obrazów?”

Odpowiedź 2: “Sieci neuronowe z wykorzystaniem splotu (CNN) to typ sieci neuronowej, który jest głównie stosowany w zadaniach rozpoznawania obrazów. W przeciwieństwie do innych sieci neuronowych, wykorzystują one warstwy splotu i warstwy pulowania do przetwarzania obrazów. Wyobraź sobie, że masz obraz kotka. Sieci CNN mogą identyfikować różne cechy w obrazie, takie jak wąsy, uszy i ogon, stosując filtry i skalując obraz przy użyciu warstw pulowania. Ten proces sprawia, że sieci CNN są bardzo skuteczne w rozpoznawaniu obiektów na obrazach.”

Porównując dwie odpowiedzi, jest oczywiste, że dobrze zdefiniowany prompt prowadzi do bardziej istotnej i przyjaznej dla użytkownika odpowiedzi. Projektowanie i inżynieria promptów to rozwijające się dyscypliny, które mają na celu optymalizację jakości wyjścia modeli AI, takich jak ChatGPT.

W następnych sekcjach tego artykułu, będziemy zagłębiać się w dziedzinę zaawansowanych metod mających na celu udoskonalenie dużych modeli językowych (LLM), takich jak techniki inżynierii promptów i taktyki. Obejmują one naukę z few-shot, ReAct, łańcuch myśli, RAG i wiele więcej.

Zaawansowane techniki inżynierskie

Przed przejściem dalej, ważne jest zrozumienie kluczowego problemu z LLM, określanego jako “halucynacja”. W kontekście LLM, “halucynacja” oznacza tendencję tych modeli do generowania wyjść, które mogą wydawać się rozsądne, ale nie są oparte na faktach lub kontekście danych wejściowych.

Ten problem został wyraźnie podkreślony w niedawnym przypadku sądowym, w którym adwokat obrony wykorzystał ChatGPT do badań prawnych. Narzędzie AI, zawodząc z powodu problemu halucynacji, cytowało nieistniejące przypadki prawne. Ten błąd miał znaczące konsekwencje, powodując zamieszanie i podważając wiarygodność podczas rozprawy. Ten incydent jest wyraźnym przypomnieniem pilnej potrzeby rozwiązania problemu “halucynacji” w systemach AI.

Nasze eksplorowanie technik inżynierii promptów ma na celu poprawienie tych aspektów LLM. Poprawiając ich wydajność i bezpieczeństwo, otwieramy drogę do innowacyjnych zastosowań, takich jak ekstrakcja informacji. Ponadto, umożliwia to płynną integrację LLM z zewnętrznymi narzędziami i źródłami danych, rozszerzając zakres ich potencjalnych zastosowań.

Nauka zero- i few-shot: optymalizacja z przykładami

Generatywne Pretrained Transformatory (GPT-3) oznaczały ważny punkt zwrotny w rozwoju modeli AI generatywnych, wprowadzając pojęcie “nauki few-shot“. Ta metoda była przełomowa ze względu na swoją zdolność do skutecznego działania bez potrzeby kompleksowego dostrajania. Ramy GPT-3 są omówione w artykule “Language Models are Few Shot Learners“, gdzie autorzy pokazują, jak model wyróżnia się w różnych przypadkach użycia bez potrzeby niestandardowych zbiorów danych lub kodu.

W przeciwieństwie do dostrajania, które wymaga ciągłego wysiłku, aby rozwiązać różne przypadki użycia, modele few-shot wykazują większą elastyczność w adaptacji do szerszego zakresu zastosowań. Chociaż dostrajanie może zapewnić solidne rozwiązania w niektórych przypadkach, może być kosztowne w skali, co czyni użycie modeli few-shot bardziej praktycznym, zwłaszcza w połączeniu z inżynierią promptów.

Wyobraź sobie, że próbujesz przetłumaczyć angielski na francuski. W nauce few-shot, dostarczyłbyś GPT-3 kilku przykładów tłumaczeń, takich jak “sea otter -> loutre de mer”. GPT-3, jako zaawansowany model, jest w stanie kontynuować dostarczanie dokładnych tłumaczeń. W nauce zero-shot, nie dostarczyłbyś żadnych przykładów, a GPT-3 nadal byłby w stanie tłumaczyć angielski na francuski skutecznie.

Pojęcie “nauki few-shot” pochodzi z idei, że model jest dostarczony z ograniczonej liczby przykładów do “nauki”. Ważne jest, aby zauważyć, że “nauka” w tym kontekście nie oznacza aktualizacji parametrów modelu lub wag, ale raczej wpływa na wydajność modelu.

Nauka few-shot z papieru GPT-3

Nauka few-shot z papieru GPT-3

Nauka zero-shot jest kolejnym krokiem w tym kierunku. W nauce zero-shot, nie dostarcza się przykładów wykonania zadania w modelu. Model jest oczekiwany, aby wykonał zadanie dobrze na podstawie swojego początkowego szkolenia, co sprawia, że ta metoda jest idealna dla scenariuszy odpowiedzi na pytania w domenie otwartej, takich jak ChatGPT.

W wielu przypadkach model biegły w nauce zero-shot może wykonywać zadania dobrze, gdy dostarczony jest z few-shot lub nawet single-shot przykładami. Ta zdolność do przełączania się między zero, single a few-shot nauką podkreśla elastyczność dużych modeli, zwiększając ich potencjalne zastosowania w różnych dziedzinach.

Metody nauki zero-shot stają się coraz bardziej popularne. Są one charakteryzowane przez swoją zdolność do rozpoznawania obiektów niewidzianych podczas szkolenia. Oto praktyczny przykład few-shot promptu:

Przetłumacz następujące angielskie frazy na francuski:

'sea otter' tłumaczy się na 'loutre de mer'
'sky' tłumaczy się na 'ciel'
Co to 'cloud' tłumaczy się na francuski?"

Poprzez dostarczenie modelowi kilku przykładów, a następnie zadanie pytania, możemy skutecznie nakierować model na wygenerowanie pożądanej odpowiedzi. W tym przypadku GPT-3 prawdopodobnie poprawnie przetłumaczy “cloud” na “nuage” w języku francuskim.

Będziemy zagłębiać się w różne niuanse techniki inżynierii promptów i jej niezwykle ważnej roli w optymalizacji wydajności modelu podczas inferencji. Będziemy również przyglądać się, jak może być ona skutecznie wykorzystana do tworzenia efektywnych i skalowalnych rozwiązań w szerokim zakresie przypadków użycia.

Podczas dalszego eksplorowania złożoności techniki inżynierii promptów w modelach GPT, ważne jest, aby podkreślić nasz poprzedni artykuł ‘Podstawowy przewodnik po inżynierii promptów w ChatGPT‘. Ten przewodnik dostarcza wglądu w strategie instruowania modeli AI skutecznie w różnych przypadkach użycia.

W naszych poprzednich dyskusjach, zagłębialiśmy się w podstawowe metody promptów dla dużych modeli językowych (LLM), takich jak nauka zero-shot i few-shot, a także instruowanie promptów. Opanowanie tych technik jest kluczowe dla radzenia sobie z bardziej złożonymi wyzwaniami inżynierii promptów, które będziemy eksplorować tutaj.

Nauka few-shot może być ograniczona ze względu na ograniczony kontekst okna większości LLM. Ponadto, bez odpowiednich zabezpieczeń, LLM mogą być wprowadzane w błąd, dostarczając potencjalnie szkodliwe wyjście. Co więcej, wiele modeli ma trudności z zadaniami wymagającymi rozumowania lub wykonywania wieloetapowych instrukcji.

Biorąc pod uwagę te ograniczenia, wyzwanie polega na wykorzystaniu LLM do rozwiązywania złożonych zadań. Oczywistym rozwiązaniem mogłoby być rozwinięcie bardziej zaawansowanych LLM lub udoskonalenie istniejących, ale to mogłoby wymagać znacznego wysiłku. Więc pytanie brzmi: jak możemy zoptymalizować obecne modele, aby poprawić ich zdolność do rozwiązywania problemów?

Równie fascynujące jest eksplorowanie, jak ta technika łączy się z zastosowaniami kreatywnymi w ‘Mastering AI Art: A Concise Guide to Midjourney and Prompt Engineering‘ Unite AI, które opisują, jak fuzja sztuki i AI może prowadzić do imponujących dzieł sztuki.

Łańcuch myśli promptingu

Łańcuch myśli promptingu wykorzystuje auto-regresyjne właściwości dużych modeli językowych (LLM), które wyróżniają się w przewidywaniu następnego słowa w danej sekwencji. Poprzez nakierowanie modelu na wyjaśnienie swojego procesu myślowego, indukuje bardziej szczegółową i metodyczną generację pomysłów, która często jest zgodna z dokładnymi informacjami. Ten wyrównanie wynika z tendencji modelu do przetwarzania i dostarczania informacji w sposób przemyślany i uporządkowany, podobnie jak ekspert prowadzi słuchacza przez złożoną koncepcję. Prosta wypowiedź, taka jak “przewiedź mnie krok po kroku…”, jest często wystarczająca, aby wywołać tę bardziej szczegółową i dokładną odpowiedź.

Zero-shot łańcuch myśli promptingu

Podczas gdy konwencjonalne łańcuch myśli promptingu wymaga wstępnego szkolenia z demonstracjami, nowy obszar to zero-shot łańcuch myśli promptingu. Ten podejście, wprowadzone przez Kojimę i innych (2022), innowacyjnie dodaje frazę “Let’s think step by step” do oryginalnego promptu.

Stworzymy zaawansowany prompt, w którym ChatGPT jest zobowiązany do podsumowania głównych wniosków z badań AI i NLP.

W tym przykładzie, będziemy wykorzystywać zdolność modelu do zrozumienia i podsumowania złożonych informacji z tekstów akademickich. Wykorzystując podejście few-shot, nauczmy ChatGPT, aby podsumować główne wnioski z badań AI i NLP:

1. Tytuł artykułu: "Attention Is All You Need"
Główny wniosek: Wprowadził model transformatora, podkreślając znaczenie mechanizmów uwagi ponad warstwami rekurencyjnymi dla zadań transdukcji sekwencji.

2. Tytuł artykułu: "BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding"
Główny wniosek: Wprowadził BERT, pokazując skuteczność pre-trenowania głębokich modeli dwukierunkowych, osiągając wyniki na poziomie stanu sztuki w różnych zadaniach NLP.

Teraz, z kontekstem tych przykładów, podsumuj główne wnioski z następującego artykułu:

Tytuł artykułu: "Prompt Engineering in Large Language Models: An Examination"

Ten prompt nie tylko utrzymuje wyraźny łańcuch myśli, ale również wykorzystuje podejście few-shot, aby nakierować model. Łączy się z naszymi słowami kluczowymi, koncentrując się na dziedzinach AI i NLP, a w szczególności zlecając ChatGPT wykonanie złożonej operacji związanej z inżynierią promptów: podsumowanie artykułów badawczych.

ReAct Prompt

ReAct, czyli “Reason and Act”, został wprowadzony przez Google (GOOGL ) w artykule “ReAct: Synergizing Reasoning and Acting in Language Models“, i rewolucjonizował sposób, w jaki modele językowe взаимодействują z zadaniami, nakierowując model na dynamiczne generowanie zarówno śladów rozumowania, jak i czynności związanych z zadaniami.

Wyobraź sobie człowieka-kucharza w kuchni: nie tylko wykonuje serię czynności (krojenie warzyw, gotowanie wody, mieszanie składników), ale również angażuje się w wewnętrzny monolog (“teraz, gdy warzywa są pokrojone, powinienem włożyć garniec na kuchenkę”). Ten ciągły monolog pomaga w strategizowaniu procesu, adaptacji do nagłych zmian (“nie mam oliwy, użyję masła zamiast”) i pamiętaniu sekwencji zadań. ReAct naśladuje tę ludzką zdolność, umożliwiając modelowi szybkie uczenie się nowych zadań i podejmowanie decyzji w sposób podobny do ludzkiego w nowych lub niepewnych sytuacjach.

ReAct może rozwiązać problem halucynacji, powszechny w systemach łańcucha myśli (CoT). CoT, chociaż jest skuteczną techniką, brakuje mu zdolności do interakcji ze światem zewnętrznym, co może prowadzić do halucynacji faktów i propagacji błędów. ReAct kompensuje to, łącząc się z zewnętrznymi źródłami informacji. Ta interakcja pozwala systemowi nie tylko na walidację swojego rozumowania, ale również na aktualizację wiedzy na podstawie najnowszych informacji ze świata zewnętrznego.

Podstawowe działanie ReAct można wyjaśnić za pomocą przykładu z HotpotQA, zadania wymagającego wysokiego poziomu rozumowania. Po otrzymaniu pytania, model ReAct rozkłada pytanie na zarządzalne części i tworzy plan działania. Model generuje ślad rozumowania (myśl) i identyfikuje odpowiednią czynność. Może zdecydować się na wyszukanie informacji o pilocie Apple (AAPL ) na zewnętrznym źródle, takim jak Wikipedia (czynność), i aktualizuje swoje zrozumienie na podstawie uzyskanych informacji (obserwacja). Przez wieloetapowy proces myśli, czynności i obserwacji, ReAct może pobrać informacje, aby wesprzeć swoje rozumowanie, jednocześnie doskonaląc to, co musi pobrać następnie.

Uwaga:

HotpotQA to zestaw danych, pochodzący z Wikipedii, składający się z 113 tys. par pytań i odpowiedzi, zaprojektowany do szkolenia systemów AI w złożonym rozumowaniu, ponieważ pytania wymagają rozumowania nad wieloma dokumentami, aby odpowiedzieć. Z drugiej strony, CommonsenseQA 2.0, zbudowany za pomocą gamifikacji, zawiera 14 343 pytania tak/nie i jest zaprojektowany do wyzwania AI w zrozumieniu zwykłych ludzkich zachowań, ponieważ pytania są celowo skonstruowane, aby wprowadzać w błąd modele AI.

Proces mógłby wyglądać następująco:

  1. Myśl: “Muszę wyszukać informacje o pilocie Apple i urządzeniach kompatybilnych.”
  2. Czynność: Wyszukuje “urządzenia kompatybilne z pilota Apple” na zewnętrznym źródle.
  3. Obserwacja: Uzyskuje listę urządzeń kompatybilnych z pilota Apple z wyników wyszukiwania.
  4. Myśl: “Na podstawie wyników wyszukiwania, kilka urządzeń, poza pilota Apple, może sterować programem, z którym został on pierwotnie zaprojektowany.”

Wynikiem jest dynamiczny, oparty na rozumowaniu proces, który może ewoluować w zależności od informacji, z którymi wchodzi w interakcję, prowadząc do bardziej dokładnych i niezawodnych odpowiedzi.

ReAct Prompt technika referencyjnego obrazu

Porównawcza wizualizacja czterech metod promptingu – Standard, łańcuch myśli, Act-Only i ReAct, w rozwiązywaniu HotpotQA i AlfWorld (https://arxiv.org/pdf/2210.03629.pdf)

Projektowanie agentów ReAct jest zadaniem specjalistycznym, biorąc pod uwagę ich zdolność do osiągania złożonych celów. Na przykład, agent konwersacyjny, zbudowany na podstawie modelu ReAct, integruje pamięć konwersacyjną, aby zapewnić bogatsze interakcje. Jednak złożoność tego zadania jest uproszczona przez narzędzia, takie jak Langchain, które stało się standardem dla projektowania tych agentów.

Promptowanie wiernego kontekstu

Artykuł ‘Promptowanie wiernego kontekstu dla dużych modeli językowych‘ podkreśla, że chociaż LLM wykazały znaczący sukces w zadaniach NLP opartych na wiedzy, ich nadmierna zależność od wiedzy parametrycznej może doprowadzić do błędów w zadaniach wrażliwych na kontekst. Na przykład, gdy model językowy jest szkolony na danych sprzed 2022 roku, może generować nieprawidłowe odpowiedzi, jeśli zignoruje wskazówki kontekstowe.

Ten problem jest widoczny w przypadkach konfliktu wiedzy, gdzie kontekst zawiera fakty różniące się od wiedzy wstępnej LLM. Rozważmy przypadku, w którym duży model językowy (LLM), zainicjowany danymi przed Mistrzostwami Świata 2022, otrzymuje kontekst wskazujący, że Francja wygrała turniej. Jednak LLM, polegając na swojej wiedzy wstępnej, nadal twierdzi, że poprzedni zwycięzca, czyli zespół, który wygrał w 2018 roku, jest nadal obecnym mistrzem. To jest klasyczny przykład “konfliktu wiedzy”.

Istotą konfliktu wiedzy w LLM jest to, że nowe informacje dostarczone w kontekście mogą sprzeciwiać się wiedzy wstępnej, którą model został wyuczony. Tendencja modelu do polegania na swojej wiedzy wstępnej zamiast nowych informacji dostarczonych w kontekście może prowadzić do nieprawidłowych wyjść.

Inny problem pojawia się, gdy dostarczony kontekst nie zawiera wystarczających informacji, aby odpowiedzieć na pytanie dokładnie, co jest znane jako przewidywanie z abstynencją. Na przykład, jeśli LLM jest pytany o założyciela Microsoftu na podstawie kontekstu, który nie zawiera tej informacji, powinien powstrzymać się od zgadywania.

Konflikt wiedzy i moc abstynencji przykłady

Więcej przykładów konfliktu wiedzy i mocy abstynencji

Aby poprawić wierność kontekstu LLM w tych sytuacjach, badacze zaproponowali szereg strategii promptingu. Te strategie mają na celu uczynienie odpowiedzi LLM bardziej dostosowanymi do kontekstu niż poleganie na ich zakodowanej wiedzy.

Jedną z takich strategii jest sformułowanie promptów jako pytania opartych na opinii, gdzie kontekst jest interpretowany jako oświadczenie narratora, a pytanie dotyczy opinii tego narratora. Ten podejście przesuwa uwagę LLM na przedstawiony kontekst, zamiast polegać na wiedzy wstępnej.

Dodanie demonstracji kontrfaktualnych do promptów również zostało zidentyfikowane jako skuteczny sposób, aby zwiększyć wierność w przypadkach konfliktu wiedzy. Te demonstracje przedstawiają scenariusze z fałszywymi faktami, które nakierowują model na zwrócenie większej uwagi na kontekst, aby dostarczyć dokładne odpowiedzi.

Dostrojenie instrukcji

Dostrojenie instrukcji to faza uczenia nadzorowanego, która wykorzystuje dostarczanie modelowi konkretnych instrukcji, na przykład “Wyjaśnij różnicę między wschodem a zachodem słońca”. Instrukcja jest połączona z odpowiednią odpowiedzią, taką jak “Wschód słońca odnosi się do momentu, gdy słońce pojawia się nad horyzontem rano, podczas gdy zachód słońca oznacza moment, gdy słońce znika poniżej horyzontu wieczorem”. Za pomocą tego podejścia, model uczy się, jak przestrzegać i wykonywać instrukcje.

Ten podejście znacząco wpływa na proces promptingu LLM, prowadząc do radykalnej zmiany w stylu promptingu. LLM dostrojony do instrukcji pozwala na natychmiastowe wykonanie zadań zero-shot, zapewniając płynne wykonanie zadań. Jeśli LLM jeszcze nie został dostrojony, podejście few-shot może być wymagane, obejmujące kilka przykładów w prompt, aby nakierować model na pożądaną odpowiedź.

Dostrojenie instrukcji z GPT-4” omawia próbę wykorzystania GPT-4 do generowania danych do dostrojenia instrukcji dla LLM. Użyto bogaty zestaw danych, składający się z 52 000 unikalnych wpisów dostrojenia instrukcji w języku angielskim i chińskim.

Zestaw danych odgrywa kluczową rolę w dostrojeniu instrukcji modeli LLaMA, serii otwartych LLM. To prowadzi do poprawy wyników zero-shot w nowych zadaniach. Warte uwagi projekty, takie jak Stanford Alpaca, skutecznie wykorzystały samo-dostrojenie instrukcji, efektywną metodę wyrównania LLM z ludzkimi intencjami, wykorzystując dane wygenerowane przez zaawansowane modele instrukcji.

Zaawansowana technika inżynierii promptów badawczy referencyjny obraz

Głównym celem badań nad dostrojeniem instrukcji jest poprawa zdolności do generalizacji zero-shot i few-shot LLM. Dalsze zbieranie danych i skalowanie modelu mogą dostarczyć cennych wglądów. Z obecnie dostępnymi danymi o rozmiarze 52K i modelem LLaMA o 7 miliardach parametrów, istnieje ogromny potencjał do zebrania większej ilości danych GPT-4 i połączenia ich z innymi źródłami danych, prowadząc do szkolenia większych modeli LLaMA dla lepszych wyników.

STaR: Bootstrapping rozumowania z rozumowaniem

Potencjał LLM jest szczególnie widoczny w złożonych zadaniach rozumowania, takich jak matematyka lub zadania zrozumienia zdrowego rozsądku. Jednak proces nakierowania modelu językowego na generowanie uzasadnień – serii krok po kroku uzasadnień lub “łańcucha myśli” – ma swoje wyzwania. Często wymaga budowy dużych zbiorów danych uzasadnień lub poświęcenia dokładności ze względu na poleganie tylko na inferencji few-shot.

“Self-Taught Reasoner” (STaR) oferuje innowacyjne rozwiązanie tych wyzwań. Wykorzystuje prostą pętlę, aby ciągle poprawiać zdolność modelu do rozumowania. Ten iteracyjny proces zaczyna się od generowania uzasadnień, aby odpowiedzieć na wiele pytań, używając kilku racjonalnych przykładów. Jeśli wygenerowane odpowiedzi są nieprawidłowe, model próbuje ponownie wygenerować uzasadnienie, tym razem dostarczając prawidłową odpowiedź. Model jest następnie dostrojony do wszystkich uzasadnień, które doprowadziły do prawidłowych odpowiedzi, a proces jest powtarzany.

Metodologia STaR, demonstrująca pętlę dostrojenia i przykładowe generowanie uzasadnienia w zestawie danych CommonsenseQA (https://arxiv.org/pdf/2203.14465.pdf)

Metodologia STaR, demonstrująca pętlę dostrojenia i przykładowe generowanie uzasadnienia w zestawie danych CommonsenseQA (https://arxiv.org/pdf/2203.14465.pdf)

Aby zilustrować to, rozważmy pytanie “Co można użyć do przeniesienia małego psa?” z wyborami odpowiedzi od basenu do kosza. Model STaR generuje uzasadnienie, identyfikując, że odpowiedź musi być czymś, co może przenosić małego psa, i dochodzi do wniosku, że kosz, zaprojektowany do przenoszenia rzeczy, jest prawidłową odpowiedzią.

Podejście STaR jest unikalne, ponieważ wykorzystuje pre-istniejącą zdolność modelu do rozumowania. Zatrudnia proces samogenerowania i udoskonalania uzasadnień, iteracyjnie bootstrapping zdolności modelu do rozumowania. Jednak pętla STaR ma swoje ograniczenia. Model może nie rozwiązać nowych problemów w zestawie treningowym, ponieważ nie otrzymuje bezpośredniego sygnału treningowego dla problemów, które nie są w stanie rozwiązać. Aby rozwiązać ten problem, STaR wprowadza racjonalizację. Dla każdego problemu, który model nie jest w stanie rozwiązać, generuje nowe uzasadnienie, dostarczając modelowi prawidłowej odpowiedzi, co pozwala modelowi na rozumowanie wstecz.

STaR jest zatem skalowalną metodą bootstrappingu, która pozwala modelom nauczyć się generować własne uzasadnienia, jednocześnie ucząc się rozwiązywać coraz trudniejsze problemy. Zastosowanie STaR wykazało obiecujące wyniki w zadaniach związanych z arytmetyką, matematyką i rozumowaniem zdroworozsądkowym. Na CommonsenseQA, STaR poprawił wyniki w porównaniu z modelem few-shot i modelem dostrojonym do bezpośredniego przewidywania odpowiedzi i wykonał lepiej niż model 30-krotnie większy.

Tagged Context Prompts

Pojęcie “Tagged Context Prompts” kręci się wokół dostarczania modelowi AI dodatkowej warstwy kontekstu poprzez oznaczenie określonych informacji w danych wejściowych. Te tagi działają jako znaczniki dla AI, nakierowując ją, jak interpretować kontekst dokładnie i wygenerować odpowiedź, która jest zarówno istotna, jak i faktualna.

Wyobraź sobie, że prowadzisz rozmowę z przyjacielem na temat określonego tematu, powiedzmy “szachy”. Zrobisz oświadczenie, a następnie oznaczysz je odniesieniem, takim jak “(źródło: Wikipedia)”. Teraz, twój przyjaciel, który w tym przypadku jest modelem AI, wie dokładnie, skąd pochodzą twoje informacje. Ten podejście ma na celu uczynienie odpowiedzi AI bardziej wiarygodnymi, redukując ryzyko halucynacji, czyli generowania fałszywych faktów.

Unikalną cechą tagged context prompts jest ich potencjał do poprawy “inteligencji kontekstowej” modeli AI. Na przykład, artykuł demonstruje to, używając zróżnicowanego zestawu pytań wyodrębnionych z różnych źródeł, takich jak podsumowane artykuły z Wikipedii na różne tematy i sekcje z niedawno opublikowanej książki. Pytania są oznaczone, dostarczając modelowi AI dodatkowego kontekstu na temat źródła informacji.

Ten dodatkowy kontekst może okazać się niezwykle korzystny, gdy chodzi o generowanie odpowiedzi, które są nie tylko dokładne, ale także przestrzegają kontekstu, czyniąc wyjście AI bardziej godnym zaufania.

Wnioski: Spojrzenie na obiecujące techniki i kierunki przyszłości

ChatGPT OpenAI pokazuje niezbadany potencjał dużych modeli językowych (LLM) w rozwiązywaniu złożonych zadań z imponującą wydajnością. Zaawansowane techniki, takie jak nauka few-shot, ReAct, łańcuch myśli i STaR, pozwalają nam wykorzystać ten potencjał w szerokim zakresie aplikacji. Gdy zagłębiamy się w niuanse tych metodologii, odkrywamy, jak kształtują one krajobraz AI, oferując bogatsze i bezpieczniejsze interakcje między ludźmi a maszynami.

Pomimo wyzwań, takich jak konflikt wiedzy, nadmierna zależność od wiedzy parametrycznej i potencjał halucynacji, te modele AI, z odpowiednią inżynierią promptów, okazały się przełomowymi narzędziami. Dostrojenie instrukcji, promptowanie wiernego kontekstu i integracja z zewnętrznymi źródłami danych dodatkowo zwiększają ich zdolność do rozumowania, uczenia się i adaptacji.

Przez ostatnie pięć lat zanurzałem się w fascynującym świecie Machine Learning i Deep Learning. Moja pasja i ekspertyza doprowadziły mnie do udziału w ponad 50 różnorodnych projektach inżynierii oprogramowania, ze szczególnym uwzględnieniem AI/ML. Moja nieustanna ciekawość również skierowała mnie w stronę Natural Language Processing, dziedziny, którą chcę dalej eksplorować.