Modele i platformy AI

Tülu 3 od Allen AI to nieoczekiwany rywal DeepSeek

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Nagłówki nie przestają przychodzić. Modele DeepSeek wyzywają benchmarki, ustanawiają nowe standardy i robią dużo szumu. Ale coś interesującego właśnie się wydarzyło w scenie badań nad sztuczną inteligencją, co również warto zwrócić uwagę.

Allen AI cicho wydał nową rodzinę modeli Tülu 3, a ich wersja z 405B parametrów nie tylko konkurowała z DeepSeek, ale również ją przewyższała w niektórych kluczowych benchmarkach.

Położmy to w perspektywie.

Model Tülu 3 z 405B parametrów rywalizuje z najlepszymi wykonawcami, takimi jak DeepSeek V3, w różnych zadaniach. Widzimy porównywalne lub lepsze wyniki w obszarach takich jak rozwiązywanie matematycznych problemów, wyzwania programistyczne i ścisłe przestrzeganie instrukcji. I robią to przy całkowicie otwartym podejściu.

Została opublikowana kompletna pipeline szkoleniowa, kod oraz nowa metoda wzmocnionego uczenia się z weryfikowalnymi nagrodami (RLVR), która umożliwiła to.

Rozwój takich technologii w ciągu ostatnich kilku tygodni zmienia sposób, w jaki odbywa się rozwój sztucznej inteligencji na najwyższym poziomie. Kiedy w pełni otwarty model może dorównać najlepszym zamkniętym modelom, otwiera to możliwości, które wcześniej były zablokowane za korporacyjnymi murami.

Bitwa techniczna

Co sprawiło, że Tülu 3 wyróżnia się? To unikalny czterostopniowy proces szkolenia, który wykracza poza tradycyjne podejścia.

Spójrzmy, jak zbudowano ten model:

Etap 1: Strategiczny wybór danych

Zespół wiedział, że jakość modelu zaczyna się od jakości danych. Połączyli uznane zestawy danych, takie jak WildChat i Open Assistant, z treścią wygenerowaną przez ludzi. Ale oto kluczowe spostrzeżenie: nie tylko agregowali dane, ale tworzyli ukierunkowane zestawy danych dla konkretnych umiejętności, takich jak rozumowanie matematyczne i biegłość w programowaniu.

Etap 2: Budowanie lepszych odpowiedzi

W drugim etapie Allen AI skupił się na nauczaniu modelu konkretnych umiejętności. Stworzyli różne zestawy danych szkoleniowych – niektóre dla matematyki, inne dla programowania i więcej dla ogólnych zadań. Przez powtarzające się testowanie tych kombinacji mogli zobaczyć dokładnie, gdzie model się sprawdza i gdzie wymaga poprawy. Ten iteracyjny proces ujawnił prawdziwy potencjał, jaki Tülu 3 mógł osiągnąć w każdej dziedzinie.

Etap 3: Uczenie się z porównań

To tutaj Allen AI został kreatywny. Zbudowali system, który mógł natychmiast porównać odpowiedzi Tülu 3 z odpowiedziami innych najlepszych modeli. Ale również rozwiązali trwały problem w sztucznej inteligencji – tendencję modeli do pisania długich odpowiedzi tylko dla samego faktu ich długości. Ich podejście, wykorzystujące normalizowaną długością bezpośredniej optymalizacji preferencji (DPO), oznaczało, że model nauczył się cenić jakość ponad ilość. Rezultat? Odpowiedzi, które są zarówno precyzyjne, jak i celowe.

Kiedy modele sztucznej inteligencji uczą się z preferencji (która odpowiedź jest lepsza, A czy B?), mają tendencję do rozwoju frustrującego uprzedzenia: zaczynają myśleć, że dłuższe odpowiedzi są zawsze lepsze. To jakby próbowali wygrać, mówiąc więcej, zamiast mówić dobrze.

Normalizowana DPO naprawia to, dostosowując, w jaki sposób model ucz się z preferencji. Zamiast po prostu patrzeć, która odpowiedź była preferowana, bierze pod uwagę długość każdej odpowiedzi. Wyobraź sobie to jako ocenianie odpowiedzi według ich jakości na słowo, a nie tylko ich łącznego wpływu.

Dlaczego to ma znaczenie? Ponieważ pomaga Tülu 3 nauczyć się być precyzyjnym i efektywnym. Zamiast wypełniać odpowiedzi dodatkowymi słowami, aby wydawać się bardziej kompletnymi, uczy się dostarczać wartość w każdej potrzebnej długości.

To może wydawać się drobnostką, ale jest kluczowe dla budowania sztucznej inteligencji, która komunikuje się naturalnie. Najlepsi ludzcy eksperci wiedzą, kiedy być zwięzłymi, a kiedy rozwinąć myśl – i to właśnie normalizowana DPO pomaga nauczyć model.

Etap 4: Innowacja RLVR

To techniczny przełom, który zasługuje na uwagę. RLVR zastępuje subiektywne modele nagród konkretną weryfikacją.

Większość modeli sztucznej inteligencji uczy się za pomocą złożonego systemu modeli nagród – podstawowo wykształconych zgadywań o tym, co stanowi dobrą odpowiedź. Ale Allen AI poszedł inną drogą z RLVR.

Pomyśl, jak szkolimy obecnie modele sztucznej inteligencji. Zwykle potrzebujemy innych modeli sztucznej inteligencji (nazywanych modelami nagród), aby ocenić, czy odpowiedź jest dobra czy nie. Jest to subiektywne, skomplikowane i często niespójne. Niektóre odpowiedzi mogą wydawać się dobre, ale zawierać subtelne błędy, które przemykają.

RLVR odwraca to podejście. Zamiast polegać na subiektywnych ocenach, wykorzystuje konkretną, weryfikowalną ocenę. Kiedy model próbuje rozwiązać matematyczny problem, nie ma szarości – odpowiedź jest albo prawidłowa, albo nieprawidłowa. Kiedy pisze kod, ten kod albo działa poprawnie, albo nie.

To staje się interesujące:

  • Model otrzymuje natychmiastową, binarną informację zwrotną: 10 punktów za poprawne odpowiedzi, 0 za niepoprawne
  • Nie ma miejsca na częściową ocenę lub nieostre oceny
  • Uczenie się staje się skupione i precyzyjne
  • Model uczy się priorytetowo traktować dokładność ponad odpowiedzi, które brzmią prawdopodobnie, ale są nieprawidłowe

Szkolenie RLVR (Allen AI)

Rezultaty? Tülu 3 wykazał znaczne poprawy w zadaniach, w których najważniejsza jest poprawność. Jego wyniki w rozumowaniu matematycznym (benchmark GSM8K) i wyzwaniach programistycznych skoczyły znacznie. Nawet jego przestrzeganie instrukcji stało się bardziej precyzyjne, ponieważ model nauczył się cenić konkretną dokładność ponad przybliżone odpowiedzi.

To, co sprawia, że jest to szczególnie ekscytujące, to sposób, w jaki zmienia to grę dla otwartych modeli sztucznej inteligencji. Poprzednie podejścia często miały trudności z osiągnięciem tej samej precyzji, co zamknięte modele w zadaniach technicznych. RLVR pokazuje, że z odpowiednim podejściem do szkolenia, otwarte modele mogą osiągnąć ten sam poziom niezawodności.

Spójrzmy na liczby

Wersja Tülu 3 z 405B parametrów konkurowała bezpośrednio z najlepszymi modelami w tej dziedzinie. Spójrzmy, gdzie wyróżnia się i co to oznacza dla otwartej sztucznej inteligencji.

Matematyka

Tülu 3 wyróżnia się w złożonym rozumowaniu matematycznym. W benchmarkach takich jak GSM8K i MATH, jego wyniki są porównywalne z wynikami DeepSeek. Model radzi sobie z wieloetapowymi problemami i wykazuje silne zdolności matematyczne.

Kod

Wyniki programistyczne są równie imponujące. Dzięki szkoleniu RLVR, Tülu 3 pisze kod, który skutecznie rozwiązuje problemy. Jego siła leży w zrozumieniu instrukcji programistycznych i wytwarzaniu funkcjonalnych rozwiązań.

Ścisłe przestrzeganie instrukcji

Zdolność modelu do przestrzegania instrukcji wyróżnia się jako podstawowa siła. Podczas gdy wiele modeli przybliża lub uogólnia instrukcje, Tülu 3 wykazuje zdumiewającą precyzję w wykonywaniu dokładnie tego, co jest wymagane.

Otwieranie czarnej skrzynki rozwoju sztucznej inteligencji

Allen AI opublikował nie tylko potężny model, ale również cały proces rozwoju.

Każdy aspekt procesu szkoleniowego jest udokumentowany i dostępny. Od czterostopniowego podejścia po metody przygotowania danych i implementację RLVR – cały proces leży otwarty do studium i replikacji. Ta przejrzystość ustanawia nowy standard w rozwoju sztucznej inteligencji o wysokiej wydajności.

Deweloperzy otrzymują kompleksowe zasoby:

  • Kompletne potoki szkoleniowe
  • Narzędzia do przetwarzania danych
  • Ramowe oceny
  • Specyfikacje wdrożeniowe

To umożliwia zespołom:

  • Modyfikację procesów szkoleniowych
  • Adaptację metod do konkretnych potrzeb
  • Rozbudowę sprawdzonych podejść
  • Tworzenie specjalistycznych wdrożeń

To przyspiesza innowacje w całej dziedzinie. Badacze mogą budować na sprawdzonych metodach, a deweloperzy mogą skupić się na ulepszeniach, zamiast zaczynać od zera.

Wzrost doskonałości otwartego oprogramowania

Sukces Tülu 3 to duży moment dla otwartego rozwoju sztucznej inteligencji. Kiedy otwarte modele dorównują lub przewyższają prywatne alternatywy, to zmienia to branżę. Zespoły badawcze na całym świecie zyskują dostęp do sprawdzonych metod, przyspieszając swoją pracę i wywołując nowe innowacje. Prywatne laboratoria sztucznej inteligencji będą musiały się dostosować – albo zwiększając przejrzystość, albo jeszcze bardziej posuwając granice technologiczne.

Spójrzmy w przyszłość, przełomy Tülu 3 w weryfikowalnych nagrodach i wieloetapowym szkoleniu wskazują na to, co nadchodzi. Zespoły mogą budować na tych fundamentach, potencjalnie pchając wydajność jeszcze wyżej. Kod istnieje, metody są udokumentowane, a nowa fala rozwoju sztucznej inteligencji się zaczęła. Dla deweloperów i badaczy możliwość eksperymentowania i ulepszania tych metod oznacza początek ekscytującego rozdziału w rozwoju sztucznej inteligencji.

Często zadawane pytania (FAQ) o Tülu 3

Co to jest Tülu 3 i jakie są jego kluczowe cechy?

Tülu 3 to rodzina otwartych modeli językowych opracowanych przez Allen AI, zbudowanych na architekturze Llama 3.1. Dostępny jest w różnych rozmiarach (8B, 70B i 405B parametrów). Tülu 3 został zaprojektowany do poprawy wydajności w różnych zadaniach, w tym wiedzy, rozumowaniu, matematyce, programowaniu, przestrzeganiu instrukcji i bezpieczeństwie.

Jaki jest proces szkolenia Tülu 3 i jakie dane są używane?

Szkolenie Tülu 3 obejmuje kilka kluczowych etapów. Po pierwsze, zespół kuratorów wybiera różnorodny zestaw podpowiedzi z publicznych zbiorów danych i syntetycznych danych ukierunkowanych na określone umiejętności, zapewniając, że dane są oczyszczone z benchmarków. Po drugie, przeprowadza się nadzorowane dostrajanie (SFT) na mieszaninie danych dotyczących przestrzegania instrukcji, matematyki i programowania. Następnie stosuje się bezpośrednią optymalizację preferencji (DPO) z danymi preferencyjnymi wygenerowanymi za pomocą ludzkiej i LLM informacji zwrotnej. Wreszcie stosuje się wzmocnione uczenie się z weryfikowalnymi nagrodami (RLVR) dla zadań o mierzonej poprawności. Tülu 3 wykorzystuje wyselekcjonowane zestawy danych dla każdego etapu, w tym instrukcje sterowane przez osobowość, matematykę i dane programistyczne.

Jak Tülu 3 podchodzi do bezpieczeństwa i jakie metryki są używane do jego oceny?

Bezpieczeństwo jest kluczowym składnikiem rozwoju Tülu 3, rozwiązywanym na każdym etapie procesu szkoleniowego. Podczas SFT używa się zestawu danych specyficznych dla bezpieczeństwa, który okazuje się w dużej mierze ortogonalny do innych danych zorientowanych na zadania.

Co to jest RLVR?

RLVR to technika, w której model jest szkolony, aby optymalizować weryfikowalną nagrodę, taką jak poprawność odpowiedzi. Różni się to od tradycyjnego RLHF, który wykorzystuje model nagród.

Alex kieruje operacjami informacyjnymi Unite.AI opartymi na sztucznej inteligencji, łącząc dziennikarstwo, badania i automatyzację, aby wspierać terminowe i skalowalne relacjonowanie sztucznej inteligencji. Jego praca pomaga zapewnić, że nowe osiągnięcia w dziedzinie AI są prezentowane efektywnie, przy jednoczesnym zachowaniu standardów redakcyjnych publikacji.