Liderzy opinii

Jak dobrze LLM może rozwiązywać skomplikowane problemy?

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Wprowadzenie i ewolucja sztucznej inteligencji generatywnej były tak nagłe i intensywne, że trudno w pełni docenić, jak bardzo ta technologia zmieniła nasze życie.

Wyobraźmy sobie sytuację sprzed zaledwie trzech lat. Tak, sztuczna inteligencja stawała się coraz bardziej powszechna, przynajmniej w teorii. Więcej ludzi wiedziało o niektórych rzeczach, które mogła robić, chociaż nawet w tym przypadku były ogromne nieporozumienia dotyczące możliwości sztucznej inteligencji. W jakiś sposób technologia została jednocześnie niedoceniona i przeceniona za to, co mogła osiągnąć. Nadal przeciętny człowiek mógł wskazać co najmniej jedną lub dwie dziedziny, w których sztuczna inteligencja była używana, wykonując wyspecjalizowane zadania bardzo dobrze, w wyspecjalizowanych środowiskach. Cokolwiek poza tym było albo nadal w laboratorium badawczym, albo po prostu nie istniało.

Porównajmy to z dzisiejszą sytuacją. Z zerowymi umiejętnościami poza możliwością napisania zdania lub zadania pytania, świat jest u naszych palców. Możemy generować obrazy, muzykę i nawet filmy, które są naprawdę unikalne i niesamowite, i mają możliwość zakłócić całe branże. Możemy przyspieszyć nasz proces wyszukiwania, zadając proste pytanie, które, jeśli zostanie odpowiednio sformułowane, może wygenerować strony niestandardowej treści wystarczająco dobrej, aby przypominać treści stworzone przez uczonych lub przeciętnego ucznia trzeciej klasy, jeśli określimy punkt widzenia. Chociaż te możliwości stały się powszechne w zaledwie roku lub dwóch, były uważane za absolutnie niemożliwe zaledwie kilka lat temu. Dziedzina sztucznej inteligencji generatywnej istniała, ale nie rozwinęła się jeszcze.

Dziś wiele osób eksperymentowało z sztuczną inteligencją generatywną, taką jak ChatGPT, Midjourney lub inne narzędzia. Inni już włączyli je do swojego codziennego życia. Szybkość, z jaką ewoluują, jest oszałamiająca, wręcz alarmująca. Biorąc pod uwagę postępy z ostatnich sześciu miesięcy, nie mamy wątpliwości, że będziemy zaskoczeni, raz po raz, w nadchodzących latach.

Jednym z konkretnych narzędzi używanych w ramach sztucznej inteligencji generatywnej jest wydajność systemów generacji uzupełnionej przez odzyskiwanie (RAG) oraz ich zdolność do myślenia przez złożone zapytania. Wprowadzenie zbioru danych FRAMES, wyjaśnionego szczegółowo w artykule na temat tego, jak działa zestaw danych do oceny, pokazuje, gdzie jesteśmy obecnie i dokąd zmierzamy. Nawet od czasu wprowadzenia FRAMES pod koniec 2024 roku, wiele platform już pobiło rekordy w zakresie ich zdolności do rozwiązywania trudnych i złożonych zapytań.

Przejdźmy do tego, co FRAMES ma za zadanie ocenić i jak dobrze różne modele sztucznej inteligencji generatywnej radzą sobie z tym. Możemy zobaczyć, jak decentralizacja i platformy open-source nie tylko utrzymują swoją pozycję (zwłaszcza Sentient Chat), ale także pozwalają użytkownikom zobaczyć niesamowite możliwości rozwiązywania problemów przez niektóre modele sztucznej inteligencji.

FRAMES jako okno do mózgu GenAI

Zestaw danych FRAMES i proces oceny koncentruje się na 824 „wieloetapowych” pytaniach, które wymagają inferencji, logicznego łączenia punktów, użycia kilku różnych źródeł w celu odzyskania kluczowych informacji oraz zdolności do logicznego połączenia ich wszystkich, aby odpowiedzieć na pytanie. Pytania wymagają od 2 do 15 dokumentów, aby odpowiedzieć na nie poprawnie, i również celowo zawierają ograniczenia, obliczenia matematyczne i wnioskowania, a także zdolność do przetwarzania logiki opartej na czasie. Innymi słowy, te pytania są niezwykle trudne i naprawdę reprezentują bardzo realne zadania badawcze, które człowiek mógłby podjąć w Internecie. Zajmujemy się tymi wyzwaniami cały czas i musimy szukać rozproszonych kluczowych kawałków informacji w morzu źródeł internetowych, łącząc informacje na podstawie różnych stron, tworząc nowe informacje przez obliczenia i wnioskowanie, oraz rozumiejąc, jak skonsolidować te fakty w poprawną odpowiedź na pytanie.

To, co badacze odkryli, gdy zestaw danych został po raz pierwszy wydany i przetestowany, to fakt, że najlepsze modele GenAI były w stanie osiągnąć pewną dokładność (około 40%) podczas korzystania z metod jednostopniowych, ale mogły osiągnąć dokładność 73%, jeśli pozwolono im zebrać wszystkie niezbędne dokumenty, aby odpowiedzieć na pytanie. Tak, 73% może nie wydawać się rewolucyjne. Ale jeśli rozumiesz dokładnie, co musi być odpowiedzią, liczba staje się znacznie bardziej imponująca.

Na przykład, jednym z konkretnych pytań jest: „W którym roku urodził się lider grupy, która pierwotnie wykonała piosenkę sampowaną w piosence Kanye Westa Power?” Jak człowiek podejdzie do rozwiązania tego problemu? Osoba mogłaby zobaczyć, że musi zgromadzić różne elementy informacji, takie jak tekst piosenki Kanye Westa Power, a następnie być w stanie przeglądać tekst i zidentyfikować punkt w piosence, w którym sampowany jest inny utwór. My, jako ludzie, moglibyśmy prawdopodobnie słuchać piosenki (nawet jeśli nie znamy jej) i być w stanie powiedzieć, kiedy sampowany jest inny utwór.

Ale pomyślmy o tym: co musiałby osiągnąć model GenAI, aby wykryć piosenkę inną niż oryginalna podczas „słuchania” jej? To jest miejsce, w którym podstawowe pytanie staje się doskonałym testem prawdziwie inteligentnej sztucznej inteligencji. I jeśli byliśmy w stanie znaleźć piosenkę, posłuchać jej i zidentyfikować sampowany tekst, to jest tylko krok 1. Wciąż musimy dowiedzieć się, jaka jest nazwa piosenki, jaka jest nazwa grupy, kto jest liderem tej grupy, a następnie, w którym roku urodził się ten człowiek.

FRAMES pokazuje, że aby odpowiedzieć na realistyczne pytania, potrzebne jest ogromne przetwarzanie myślowe. Dwie rzeczy przychodzą mi na myśl w tym kontekście.

Po pierwsze, zdolność decentralizowanych modeli GenAI do nie tylko konkurowania, ale potencjalnego dominowania wyników, jest niesamowita. Rosnąca liczba firm używa metody decentralizacji, aby zwiększyć swoje możliwości przetwarzania, jednocześnie zapewniając, że duże społeczności posiadają oprogramowanie, a nie scentralizowana czarna skrzynka, która nie udostępnia swoich postępów. Firmy takie jak Perplexity i Sentient są liderami tego trendu, każda z nimi posiada potężne modele, które osiągają wyniki powyżej pierwszych rekordów dokładności, gdy FRAMES zostało po raz pierwszy wydane.

Drugi element to to, że mniejsza liczba tych modeli sztucznej inteligencji nie tylko jest decentralizowana, ale także open-source. Na przykład, Sentient Chat jest oba, a wczesne testy pokazują, jak złożone może być jego rozwiązywanie problemów, dzięki niezwykle cennemu dostępowi do kodu źródłowego. Pytanie FRAMES jest odpowiedzią przy użyciu tego samego procesu myślowego, jaki używałby człowiek, z dostępnymi szczegółami rozwiązywania. Może nawet bardziej interesujące, ich platforma jest zbudowana z serii modeli, które mogą dostosować określony punkt widzenia i wydajność, nawet jeśli proces dostosowywania w niektórych modelach GenAI prowadzi do zmniejszenia dokładności. W przypadku Sentient Chat wiele różnych modeli zostało opracowanych. Na przykład, niedawny model o nazwie „Dobby 8B” jest w stanie nie tylko pobić rekord FRAMES, ale także rozwinąć wyraźną postawę pro-kryptowalutową i pro-wolnościową, co wpływa na punkt widzenia modelu, gdy przetwarza informacje i rozwija odpowiedź.

Na horyzoncie

Kluczem do tych wszystkich niesamowitych innowacji jest szybkość, z jaką doszliśmy do tego miejsca. Musimy przyznać, że tak szybko, jak ta technologia ewoluowała, będzie ewoluowała jeszcze szybciej w najbliższej przyszłości. Będziemy w stanie zobaczyć, zwłaszcza z decentralizowanymi i open-source modelami GenAI, ten kluczowy próg, w którym inteligencja systemu zaczyna przewyższać naszą własną, i co to oznacza dla przyszłości.

David Balaban jest badaczem bezpieczeństwa komputerowego z ponad 17-letnim doświadczeniem w analizie złośliwego oprogramowania i ocenie oprogramowania antywirusowego. David prowadzi MacSecurity.net i Privacy-PC.com projekty, które prezentują opinie ekspertów na temat współczesnych spraw związanych z bezpieczeństwem informacji, w tym inżynierię społeczną, złośliwe oprogramowanie, testy penetracyjne, wywiad zagrożeń, prywatność online i hakowanie w białym kapeluszu. David ma silne doświadczenie w rozwiązywaniu problemów z złośliwym oprogramowaniem, z niedawnym skupieniem na przeciwdziałaniu oprogramowaniu ransomware.