Modele i platformy AI
Dlaczego duże modele językowe pomijają instrukcje i jak rozwiązać ten problem

Duże modele językowe (LLM) szybko stały się niezastąpionymi narzędziami sztucznej inteligencji (AI), napędzającymi aplikacje od czatbotów i tworzenia treści po pomoc w kodowaniu. Pomimo ich imponujących możliwości, powszechnym wyzwaniem, z którym spotykają się użytkownicy, jest to, że te modele czasami pomijają części otrzymanych instrukcji, szczególnie gdy instrukcje są długie lub obejmują wiele kroków. To pomijanie prowadzi do niekompletnych lub niedokładnych wyników, co może powodować zamieszanie i podważać zaufanie do systemów AI. Zrozumienie, dlaczego LLM pomijają instrukcje i jak rozwiązać ten problem, jest niezbędne dla użytkowników, którzy polegają na tych modelach w celu uzyskania precyzyjnych i niezawodnych wyników.
Dlaczego LLM pomijają instrukcje?
LLM działają poprzez odczytywanie tekstu wejściowego jako sekwencji tokenów. Tokeny są małymi częściami, na które dzieli się tekst. Model przetwarza te tokeny jeden po drugim, od początku do końca. Oznacza to, że instrukcje na początku wejścia mają tendencję do otrzymywania więcej uwagi. Późniejsze instrukcje mogą otrzymać mniej uwagi i mogą być ignorowane.
To się dzieje, ponieważ LLM mają ograniczoną pojemność uwagi. Uwaga jest mechanizmem, którym model decyduje, które części wejścia są istotne podczas generowania odpowiedzi. Gdy wejście jest krótkie, uwaga działa dobrze. Ale uwaga staje się słabsza, gdy wejście staje się dłuższe lub instrukcje stają się złożone. To osłabia uwagę na późniejsze części, powodując pomijanie.
Ponadto wiele instrukcji jednocześnie zwiększa złożoność. Gdy instrukcje nachodzą na siebie lub są sprzeczne, modele mogą się pogubić. Mogą próbować odpowiedzieć na wszystko, ale produkować mgliste lub sprzeczne odpowiedzi. To często powoduje pomijanie niektórych instrukcji.
LLM również dzielą niektóre ludzkie ograniczenia. Na przykład, ludzie mogą stracić uwagę, gdy czytają długie lub powtarzające się teksty. Podobnie, LLM mogą zapomnieć późniejsze instrukcje, gdy przetwarzają więcej tokenów. Ta utrata uwagi jest częścią projektu modelu i ograniczeń.
Innym powodem jest to, jak LLM są szkolone. Widzą wiele przykładów prostych instrukcji, ale mniej złożonych, wieloetapowych. Z tego powodu modele mają tendencję do preferowania prostych instrukcji, które są bardziej powszechne w ich danych szkoleniowych. To uprzedzenie powoduje, że pomijają złożone instrukcje. Ponadto, ograniczenia tokenów ograniczają ilość wejścia, które model może przetworzyć. Gdy wejścia przekraczają te ograniczenia, instrukcje poza limitem są ignorowane.
Przykład: Załóżmy, że dasz LLM pięć instrukcji w jednej ramce. Model może skoncentrować się głównie na pierwszych dwóch instrukcjach i częściowo lub całkowicie zignorować ostatnie trzy. To bezpośrednio wpływa na to, jak model przetwarza tokeny sekwencyjnie i jego ograniczenia uwagi.
Jak dobrze LLM zarządzają sekwencyjnymi instrukcjami na podstawie wyników SIFo 2024
Niedawne badania dokładnie przyjrzeli się, jak dobrze LLM wykonują wiele instrukcji podanych jeden po drugim. Jednym z ważnych badań jest Sequential Instructions Following (SIFo) Benchmark 2024. Ten benchmark testuje modele na zadaniach, które wymagają sekwencyjnego wykonania instrukcji, takich jak modyfikacja tekstu, odpowiedzi na pytania, matematyka i przestrzeganie zasad bezpieczeństwa. Każda instrukcja w sekwencji zależy od poprawnego wykonania poprzedniej. To podejście pomaga sprawdzić, czy model poprawnie wykonał całą sekwencję.
Wyniki z SIFo pokazują, że nawet najlepsze LLM, takie jak GPT-4 i Claude-3, często mają trudności z wykonaniem wszystkich instrukcji poprawnie. Jest to szczególnie prawdziwe, gdy instrukcje są długie lub skomplikowane. Badanie wskazuje na trzy główne problemy, z którymi LLM spotykają się przy wykonywaniu instrukcji:
Zrozumienie: Pełne zrozumienie każdej instrukcji.
Reasoning: Łączenie kilku instrukcji logicznie, aby utrzymać odpowiedź klarowną.
Niezawodna odpowiedź: Produkcja kompletnych i dokładnych odpowiedzi, obejmujących wszystkie instrukcje.
Techniki takie jak projektowanie ramki i dostrajanie pomagają poprawić, jak dobrze modele wykonują instrukcje. Jednak te metody nie całkowicie pomagają w problemie pomijania instrukcji. Używanie Reinforcement Learning with Human Feedback (RLHF) dalej poprawia zdolność modelu do odpowiedzi odpowiednio. Nadal jednak modele mają trudności, gdy instrukcje wymagają wielu kroków lub są bardzo złożone.
Badanie również pokazuje, że LLM działają najlepiej, gdy instrukcje są proste, wyraźnie oddzielone i dobrze zorganizowane. Gdy zadania wymagają długich łańcuchów rozumowania lub wielu kroków, dokładność modelu spada. Te wyniki pomagają sugerować lepsze sposoby korzystania z LLM i pokazują potrzebę budowania silniejszych modeli, które mogą naprawdę wykonywać instrukcje jeden po drugim.
Dlaczego LLM pomijają instrukcje: techniczne wyzwania i praktyczne rozważania
LLM mogą pomijać instrukcje z powodu kilku technicznych i praktycznych czynników, które są zakorzenione w tym, jak przetwarzają i kodują tekst wejściowy.
Ograniczona pojemność uwagi i rozcieńczenie informacji
LLM polegają na mechanizmach uwagi, aby nadać wagę różnym częściom wejścia. Gdy ramki są zwięzłe, uwaga modelu jest skupiona i skuteczna. Jednak gdy ramka rośnie dłuższa lub bardziej powtarzalna, uwaga staje się rozcieńczona, a późniejsze tokeny lub instrukcje otrzymują mniej uwagi, zwiększając prawdopodobieństwo, że będą pomijane. To zjawisko, znane jako rozcieńczenie informacji, jest szczególnie problematyczne dla instrukcji, które pojawiają się późno w ramce. Dodatkowo, modele mają stałe limity tokenów (np. 2048 tokenów); każdy tekst poza tym progiem jest obcinany i ignorowany, powodując, że instrukcje na końcu są całkowicie pomijane.
Złożoność i niejasność odpowiedzi
LLM mogą mieć trudności z generowaniem klarownych i kompletnych odpowiedzi, gdy są konfrontowane z wieloma lub sprzecznymi instrukcjami. Model może generować częściowe lub mgliste odpowiedzi, aby uniknąć sprzeczności lub zamieszania, skutecznie pomijając niektóre instrukcje. Niejasność w tym, jak instrukcje są sformułowane, również stanowi wyzwanie: niejasne lub niedokładne ramki sprawiają, że trudno modelowi określić zamierzone działania, zwiększając ryzyko pomijania lub błędnego interpretowania części wejścia.
Wrażliwość projektowania ramki i formatowania
Struktura i sformułowanie ramki również odgrywają krytyczną rolę w wykonywaniu instrukcji. Badania pokazują, że nawet niewielkie zmiany w tym, jak instrukcje są napisane lub sformułowane, mogą znacznie wpłynąć na to, czy model przestrzega ich.
Słabo zorganizowane ramki, brakuje wyraźnego oddzielenia, punktów lub numeracji, utrudniają modelowi rozróżnienie między krokami, zwiększając szansę na scalenie lub pominięcie instrukcji. Wewnętrzna reprezentacja ramki przez model jest bardzo wrażliwa na te zmiany, co wyjaśnia, dlaczego projektowanie ramki (przeformułowanie lub reorganizacja ramki) może znacznie poprawić przestrzeganie instrukcji, nawet jeśli podstawowa treść pozostaje taka sama.
Jak naprawić pomijanie instrukcji w LLM
Poprawienie zdolności LLM do wykonywania instrukcji dokładnie jest niezbędne do produkcji niezawodnych i precyzyjnych wyników. Następujące najlepsze praktyki powinny być brane pod uwagę, aby zminimalizować pomijanie instrukcji i poprawić jakość odpowiedzi AI:
Zadania powinny być podzielone na mniejsze części
Długie lub wieloetapowe ramki powinny być podzielone na mniejsze, bardziej skupione segmenty. Podawanie jednej lub dwóch instrukcji na raz pozwala modelowi utrzymać lepszą uwagę i zmniejsza prawdopodobieństwo pominięcia jakichkolwiek kroków.
Przykład
Zamiast łączyć wszystkie instrukcje w jednej ramce, takiej jak “Podsumuj tekst, wymień główne punkty, zasugeruj poprawki i przetłumacz go na francuski”, każda instrukcja powinna być przedstawiona oddzielnie lub w mniejszych grupach.
Instrukcje powinny być sformatowane przy użyciu numerowanych list lub punktów
Organizowanie instrukcji z wyraźnym formatowaniem, takim jak numerowane listy lub punkty, pomaga wskazać, że każdy punkt jest oddzielnym zadaniem. To klarowność zwiększa szansę, że odpowiedź będzie uwzględniać wszystkie instrukcje.
Przykład
- Podsumuj następujący tekst.
- Wymień główne punkty.
- Zasugeruj poprawki.
Taka struktura zapewnia wizualne wskazówki, które pomagają modelowi rozpoznać i oddzielić odrębne zadania w ramce.
Instrukcje powinny być jawne i niejednoznaczne
Jest niezbędne, aby instrukcje wyraźnie stwierdzały wymóg wykonania każdego kroku. Język niejasny lub mglisty powinien być unikany. Ramka powinna wyraźnie wskazywać, że nie wolno pomijać żadnych kroków.
Przykład
“Proszę wykonać wszystkie trzy zadania poniżej. Pomijanie kroków nie jest dozwolone.”
Bezpośrednie oświadczenia takie jak to zmniejszają zamieszanie i zachęcają model do udzielania kompletnych odpowiedzi.
Oddzielne ramki powinny być używane dla zadań o wysokim ryzyku lub krytycznych
Każda instrukcja powinna być przedstawiona jako oddzielna ramka dla zadań, w których dokładność i kompletność są krytyczne. Chociaż ten podejście może zwiększyć czas interakcji, znacznie poprawia prawdopodobieństwo uzyskania kompletnych i precyzyjnych wyników. Ten sposób zapewnia, że model skupia się całkowicie na jednym zadaniu na raz, zmniejszając ryzyko pominięcia instrukcji.
Zaawansowane strategie, aby zrównoważyć kompletność i wydajność
Czekanie na odpowiedź po każdej instrukcji może być czasochłonne dla użytkowników. Aby poprawić wydajność, jednocześnie utrzymując klarowność i zmniejszając pomijanie instrukcji, następujące zaawansowane techniki ramkowania mogą być skuteczne:
Partie instrukcji z klarownym formatowaniem i wyraźnymi etykietami
Wiele powiązanych instrukcji może być połączonych w jedną ramkę, ale każda powinna być oddzielona przy użyciu numeracji lub nagłówków. Ramka powinna również nakazywać modelowi odpowiedzieć na wszystkie instrukcje w całości i w porządku.
Przykładowa ramka
Proszę wykonać wszystkie poniższe zadania starannie, bez pomijania żadnych:
- Podsumuj tekst poniżej.
- Wymień główne punkty z twojego podsumowania.
- Zasugeruj poprawki na podstawie głównych punktów.
- Przetłumacz poprawiony tekst na francuski.
Łańcuch myślowy w stylu ramkowania
Łańcuch myślowy w stylu ramkowania prowadzi model do przetwarzania każdego zadania sekwencyjnie, zanim udzieli odpowiedzi. Zachęcanie modelu do przetwarzania instrukcji sekwencyjnie w ramach jednej odpowiedzi pomaga zapewnić, że nie pomija się żadnych kroków, zmniejszając szansę na pomijanie instrukcji i poprawiając kompletność.
Przykładowa ramka
Przeczytaj tekst poniżej i wykonaj poniższe zadania w porządku. Pokaż swoją pracę wyraźnie:
- Podsumuj tekst.
- Zidentyfikuj główne punkty z twojego podsumowania.
- Zasugeruj poprawki do tekstu.
- Przetłumacz poprawiony tekst na francuski.
Proszę odpowiedzieć na wszystkie zadania w całości i oddzielnie w jednej odpowiedzi.
Dodaj instrukcje ukończenia i przypomnienia
Wyraźnie przypomnij modelowi, aby:
- “Odpowiedzieć na każde zadanie w całości.”
- “Nie pomijać żadnej instrukcji.”
- “Oddzielić odpowiedzi wyraźnie.”
Takie przypomnienia pomagają modelowi skupić się na kompletności, gdy wiele instrukcji jest łączonych.
Różne modele i ustawienia parametrów powinny być przetestowane
Nie wszystkie LLM wykonują równie dobrze instrukcje wielokrotne. Zalecane jest ocenienie różnych modeli, aby zidentyfikować te, które wyróżniają się w zadaniach wieloetapowych. Dodatkowo, dostosowanie parametrów, takich jak temperatura, maksymalna liczba tokenów i ramki systemowe, może dalej poprawić skupienie i kompletność odpowiedzi. Testowanie tych ustawień pomaga dostosować zachowanie modelu do konkretnych wymagań zadania.
Dostosowanie modeli i korzystanie z zewnętrznych narzędzi powinno być rozważane
Modele powinny być dostosowane do danych, które zawierają instrukcje wieloetapowe lub sekwencyjne, aby poprawić ich przestrzeganie złożonych ramkowania. Techniki takie jak RLHF mogą dalej poprawić wykonywanie instrukcji.
Dla zaawansowanych przypadków użycia, integracja zewnętrznych narzędzi, takich jak API, wtyczki specyficzne dla zadania lub Retrieval Augmented Generation (RAG) systemy, mogą zapewnić dodatkowy kontekst i kontrolę, poprawiając niezawodność i dokładność wyników.
Podsumowanie
LLM są potężnymi narzędziami, ale mogą pomijać instrukcje, gdy ramki są długie lub złożone. To się dzieje z powodu tego, jak czytają wejście i skupiają uwagę. Instrukcje powinny być klarowne, proste i dobrze zorganizowane, aby uzyskać lepsze i bardziej niezawodne wyniki. Dzielenie zadań na mniejsze części, używanie list i dawanie bezpośrednich instrukcji pomaga modelom wykonywać kroki w całości.
Oddzielne ramki mogą poprawić dokładność dla krytycznych zadań, chociaż zajmują więcej czasu. Ponadto, zaawansowane metody ramkowania, takie jak łańcuch myślowy i klarowne formatowanie, pomagają zrównoważyć szybkość i precyzję. Dodatkowo, testowanie różnych modeli i dostosowanie może również poprawić wyniki. Te pomysły pomogą użytkownikom uzyskać spójne, kompletnie odpowiedzi i uczynić narzędzia AI bardziej użytecznymi w pracy.












