Modele i platformy AI
Od intencji do wykonania: Jak Microsoft przekształca duże modele językowe w action-oriented AI
Duże modele językowe (LLM) zmieniły sposób, w jaki radzimy sobie z przetwarzaniem języka naturalnego. Mogą one odpowiadać na pytania, pisać kod i prowadzić rozmowy. Jednak nie radzą sobie dobrze z zadaniami związanymi z rzeczywistymi zadaniami. Na przykład, LLM może nakierować Cię na kupno kurta, ale nie może złożyć zamówienia. Ta luka między myśleniem a działaniem jest dużym ograniczeniem. Ludzie nie potrzebują tylko informacji; chcą wyników.
Aby zabić tę lukę, Microsoft (MSFT ) zmienia LLM w action-oriented AI agentów. Poprzez umożliwienie im planowania, rozkładania zadań i angażowania się w interakcje ze światem rzeczywistym, nadają LLM możliwość skutecznego zarządzania praktycznymi zadaniami. Ten krok ma potencjał, aby przedefiniować to, co LLM mogą robić, zmieniając je w narzędzia, które automatyzują złożone przepływy pracy i upraszczają codzienne zadania. Zobaczmy, co jest potrzebne, aby to się stało, i jak Microsoft podchodzi do tego problemu.
Czego potrzebują LLM, aby działać
Aby LLM mogły wykonywać zadania w świecie rzeczywistym, muszą one wyjść poza zrozumienie tekstu. Muszą one wchodzić w interakcje z cyfrowymi i fizycznymi środowiskami, dostosowując się do zmieniających się warunków. Oto niektóre z możliwości, których potrzebują:
-
Zrozumienie intencji użytkownika
Aby działać skutecznie, LLM muszą zrozumieć żądania użytkowników. Dane wejściowe, takie jak tekst lub polecenia głosowe, są często niejasne lub niepełne. System musi wypełnić luki za pomocą swojej wiedzy i kontekstu żądania. Rozmowy wieloetapowe mogą pomóc w udoskonaleniu tych intencji, zapewniając, że AI zrozumie, zanim podejmie działanie.
-
Przekształcanie intencji w działania
Po zrozumieniu zadania, LLM muszą przekształcić je w kroki działania. Może to obejmować klikanie przycisków, wywoływanie interfejsów API lub kontrolowanie urządzeń fizycznych. LLM muszą dostosować swoje działania do konkretnego zadania, dostosowując się do środowiska i rozwiązywania problemów, które pojawiają się.
-
Dostosowanie do zmian
Zadania w świecie rzeczywistym nie zawsze idą zgodnie z planem. LLM muszą przewidywać problemy, dostosowywać kroki i znajdować alternatywy, gdy pojawiają się problemy. Na przykład, jeśli niezbędny zasób nie jest dostępny, system powinien znaleźć inny sposób, aby ukończyć zadanie. Ta elastyczność zapewnia, że proces nie zatrzymuje się, gdy rzeczy się zmieniają.
-
Specjalizacja w konkretnych zadaniach
Chociaż LLM są zaprojektowane do ogólnego użycia, specjalizacja sprawia, że są one bardziej wydajne. Poprzez skupienie się na konkretnych zadaniach, te systemy mogą dostarczyć lepsze wyniki z mniejszą ilością zasobów. Jest to szczególnie ważne dla urządzeń z ograniczoną mocą obliczeniową, takich jak smartfony lub systemy osadzone.
Poprzez rozwijanie tych umiejętności, LLM mogą wyjść poza samą tylko przetwarzanie informacji. Mogą one podejmować znaczące działania, otwierając drogę do tego, aby AI mogło się bezproblemowo integrować z codziennymi przepływami pracy.
Jak Microsoft przekształca LLM
Podejście Microsoftu do tworzenia action-oriented AI obejmuje strukturalny proces. Głównym celem jest umożliwienie LLM zrozumienia poleceń, efektywnego planowania i podejmowania działań. Oto, jak to robią:
Krok 1: Zbieranie i przygotowanie danych
W pierwszym etapie zebrali dane związane z ich konkretnymi przypadkami użycia: Agent UFO (opisanym poniżej). Dane obejmują zapytania użytkowników, szczegóły środowiska i dane dotyczące zadań. Dwa różne rodzaje danych są zbierane w tym etapie: po pierwsze, zebrali dane planu zadania, które pomagają LLM wyznaczyć ogólne kroki niezbędne do ukończenia zadania. Na przykład “Zmień rozmiar czcionki w Word” może obejmować kroki, takie jak wybranie tekstu i dostosowanie ustawień paska narzędzi. Po drugie, zebrali dane dotyczące działań zadań, które umożliwiają LLM przekształcenie tych kroków w precyzyjne instrukcje, takie jak klikanie konkretnych przycisków lub używanie skrótów klawiszowych.
To połączenie daje modelowi zarówno ogólny zarys, jak i szczegółowe instrukcje, których potrzebuje, aby wykonywać zadania skutecznie.
Krok 2: Szkolenie modelu
Po zebraniu danych LLM są szkolone w wielu sesjach szkoleniowych. W pierwszym kroku LLM są szkolone w planowaniu zadań, ucząc je, jak rozbić żądania użytkowników na kroki działania. Następnie dane oznaczone przez ekspertów są używane do nauczenia ich, jak przekształcić te plany w konkretnych działaniach. Aby dalej poprawić ich możliwości rozwiązywania problemów, LLM biorą udział w procesie samodoskonalenia, który umożliwia im radzenie sobie z nierozwiązanymi zadaniami i generowanie nowych przykładów do ciągłego uczenia. Na koniec stosuje się uczenie wzmacnianie, używając informacji zwrotnej z sukcesów i porażek, aby dalej udoskonalić ich podejmowanie decyzji.
Krok 3: Testowanie w trybie offline
Po szkoleniu model jest testowany w kontrolowanych środowiskach, aby zapewnić niezawodność. Metryki, takie jak Wskaźnik powodzenia zadań (TSR) i Wskaźnik powodzenia kroków (SSR), są używane do pomiaru wydajności. Na przykład, testowanie agenta zarządzającego kalendarzem może obejmować weryfikację jego zdolności do planowania spotkań i wysyłania zaproszeń bez błędów.
Krok 4: Integracja z systemami rzeczywistymi
Po walidacji model jest integrowany z ramą agenta. To pozwoliło mu wchodzić w interakcje z środowiskami rzeczywistymi, takimi jak klikanie przycisków lub nawigowanie po menu. Narzędzia, takie jak API automatyzacji interfejsu użytkownika, pomogły systemowi identyfikować i manipulować elementami interfejsu użytkownika dynamicznie.
Na przykład, jeśli zadaniem jest zaznaczenie tekstu w Word, agent identyfikuje przycisk zaznaczenia, wybiera tekst i stosuje formatowanie. Składnik pamięci może pomóc LLM w śledzeniu poprzednich działań, umożliwiając im dostosowanie się do nowych scenariuszy.
Krok 5: Testowanie w środowisku rzeczywistym
Ostatnim krokiem jest ocena online. Tutaj system jest testowany w scenariuszach rzeczywistych, aby upewnić się, że może radzić sobie z nieoczekiwanymi zmianami i błędami. Na przykład, bot wsparcia klienta może prowadzić użytkowników przez resetowanie hasła, dostosowując się do niepoprawnych danych wejściowych lub brakujących informacji. To testowanie zapewnia, że AI jest solidne i gotowe do codziennego użycia.
Praktyczny przykład: Agent UFO
Aby pokazać, jak action-oriented AI działa, Microsoft opracował Agent UFO. Ten system jest zaprojektowany do wykonywania zadań rzeczywistych w środowiskach Windows, zmieniając żądania użytkowników w wykonane działania.
W swojej istocie Agent UFO używa LLM do interpretacji żądań i planowania działań. Na przykład, jeśli użytkownik powie: “Zaznacz słowo ‘ważne’ w tym dokumencie”, agent wchodzi w interakcje z Word, aby ukończyć zadanie. Zbiera informacje kontekstowe, takie jak położenie elementów interfejsu użytkownika, i używa ich do planowania i wykonania działań.
Agent UFO opiera się na narzędziach, takich jak Windows UI Automation (UIA) API. To API skanuje aplikacje w poszukiwaniu elementów sterowania, takich jak przyciski lub menu. Dla zadania, takiego jak “Zapisz dokument jako PDF”, agent używa UIA, aby zidentyfikować przycisk “Plik”, znaleźć opcję “Zapisz jako” i wykonać niezbędne kroki. Poprzez strukturyzowanie danych w sposób spójny, system zapewnia gładkie działanie od szkolenia do zastosowania w środowisku rzeczywistym.
Pokonywanie wyzwań
Chociaż jest to ekscytujący rozwój, tworzenie action-oriented AI wiąże się z wyzwaniami. Skalowalność jest dużym problemem. Szkolenie i wdrażanie tych modeli w różnych zadaniach wymaga znacznych zasobów. Zapewnienie bezpieczeństwa i niezawodności jest równie ważne. Modele muszą wykonywać zadania bez niezamierzonych konsekwencji, szczególnie w wrażliwych środowiskach. A ponieważ te systemy wchodzą w interakcje z danymi prywatnymi, utrzymanie standardów etycznych dotyczących prywatności i bezpieczeństwa jest również kluczowe.
Droga rozwoju Microsoftu koncentruje się na poprawie wydajności, rozszerzaniu przypadków użycia i utrzymaniu standardów etycznych. Z tymi postępami LLM mogą przedefiniować, jak AI wchodzi w interakcje ze światem, czyniąc je bardziej praktycznymi, dostosowanymi i action-oriented.
Przyszłość AI
Przekształcanie LLM w action-oriented agentów może być przełomem. Te systemy mogą automatyzować zadania, upraszczać przepływy pracy i czynić technologię bardziej dostępną. Praca Microsoftu nad action-oriented AI i narzędziami, takimi jak Agent UFO, jest tylko początkiem. W miarę ewolucji AI możemy oczekiwać bardziej inteligentnych, zdolnych systemów, które nie tylko wchodzą w interakcje z nami, ale także wykonują zadania.












