Modele i platformy AI
Samochód LLM: Przełom w komunikacji między ludźmi a pojazdami autonomicznymi

Pojazdy autonomiczne (AV) są coraz bliżej powszechnego stosowania, ale nadal istnieje znaczące wyzwanie: mostek komunikacyjny między ludzkimi pasażerami a ich robotycznymi kierowcami. Chociaż AV uczyniły znaczące postępy w nawigowaniu złożonych środowisk drogowych, często mają trudności z interpretowaniem nuansowanych, naturalnych poleceń językowych, które przychodzą tak łatwo ludzkim kierowcom.
Wkraczają innowacyjne badanie z Purdue University’s Lyles School of Civil and Construction Engineering. Pod przewodnictwem asystenta profesora Zirana Wang, zespół inżynierów zapoczątkował innowacyjne podejście do poprawy interakcji między AV a ludźmi przy użyciu sztucznej inteligencji. Ich rozwiązanie polega na integracji dużych modeli językowych (LLM) jak ChatGPT z systemami jazdy autonomicznej.’
Moc języka naturalnego w AV
LLM reprezentują skok w możliwościach AI do zrozumienia i generowania tekstów podobnych do ludzkich. Te zaawansowane systemy AI są szkolone na ogromnych ilościach danych tekstowych, co pozwala im pojąć kontekst, nuans i implikowaną treść w sposób, który tradycyjne odpowiedzi zaprogramowane nie mogą.
W kontekście pojazdów autonomicznych, LLM oferują przełomową możliwość. W przeciwieństwie do konwencjonalnych interfejsów AV, które polegają na konkretnych poleceniach głosowych lub wejściach przyciskowych, LLM mogą interpretować szeroki zakres naturalnych poleceń językowych. Oznacza to, że pasażerowie mogą komunikować się ze swoimi pojazdami w sposób bardzo podobny do tego, w jaki rozmawiają z ludzkim kierowcą.
Ulepszenie możliwości komunikacyjnych AV jest znaczące. Wyobraź sobie, że mówisz do swojego samochodu: “Spieszę się”, i on automatycznie oblicza najbardziej efektywną trasę, dostosowując swój styl jazdy, aby bezpiecznie zminimalizować czas podróży. Albo rozważ możliwość powiedzenia: “Czuję się trochę choroby lokomocyjnej”, co powoduje, że pojazd dostosowuje swój profil ruchu, aby zapewnić gładką jazdę. Te nuansowane interakcje, które ludzcy kierowcy intuicyjnie rozumieją, stają się możliwe dla AV dzięki integracji LLM.

Asystent profesora Ziran Wang z Purdue University stoi obok testowego pojazdu autonomicznego, który on i jego studenci wyposażyli w możliwość interpretowania poleceń od pasażerów przy użyciu ChatGPT lub innych dużych modeli językowych. (Purdue University photo/John Underwood)
Badanie Purdue: Metodologia i wyniki
Aby przetestować potencjał LLM w pojazdach autonomicznych, zespół Purdue przeprowadził serię eksperymentów z użyciem pojazdu autonomicznego poziomu czterech – jednego stopnia od pełnej autonomii, zgodnie z definicją SAE International.
Badacze zaczęli od szkolenia ChatGPT, aby reagował na szereg poleceń, od bezpośrednich instrukcji, takich jak “Proszę, jedź szybciej”, po bardziej pośrednie prośby, takie jak “Czuję się trochę choroby lokomocyjnej”. Następnie zintegrowali ten wytrenowany model z istniejącymi systemami pojazdu, pozwalając mu uwzględniać czynniki, takie jak przepisy ruchu drogowego, stan drogi, pogoda i dane sensoryczne przy interpretowaniu poleceń.
Ustawienie eksperymentalne było rygorystyczne. Większość testów przeprowadzono na poligonie w Columbus, Indiana – dawnym pasie startowym, który umożliwiał bezpieczne testy na wysokich prędkościach. Dodatkowe testy parkowania przeprowadzono na parkingu stadionu Ross-Ade. W trakcie eksperymentów LLM wspomagany AV reagował na wcześniej nauczonych i nowe polecenia od pasażerów.
Wyniki były obiecujące. Uczestnicy zgłaszali znacznie niższe wskaźniki dyskomfortu w porównaniu z typowymi doświadczeniami w pojazdach autonomicznych poziomu czterech bez pomocy LLM. Pojazd konsekwentnie przewyższał podstawowe wskaźniki bezpieczeństwa i komfortu, nawet gdy reagował na polecenia, których nie był wyraźnie nauczony.
Być może najbardziej imponujące było to, że system wykazał zdolność do uczenia się i adaptacji do indywidualnych preferencji pasażerów w trakcie podróży, pokazując potencjał dla prawdziwie personalizowanego transportu autonomicznego.

Doktorant Can Cui z Purdue University siedzi w testowym pojeździe autonomicznym. Mikrofon w konsoli odbiera jego polecenia, które duże modele językowe w chmurze interpretują. Pojazd porusza się zgodnie z instrukcjami wygenerowanymi z dużych modeli językowych. (Purdue University photo/John Underwood)
Wnioski dla przyszłości transportu
Dla użytkowników korzyści są wielorakie. Możliwość komunikowania się naturalnie z AV zmniejsza krzywą uczenia się nowej technologii, czyniąc pojazdy autonomiczne bardziej dostępnymi dla szerszego grona ludzi, w tym tych, którzy mogą być zastraszani przez złożone interfejsy. Co więcej, możliwości personalizacji pokazane w badaniu Purdue sugerują przyszłość, w której AV mogą dostosowywać się do indywidualnych preferencji, zapewniając dopasowaną do potrzeb każdego pasażera.
Ta poprawiona interakcja mogłaby również poprawić bezpieczeństwo. Poprzez lepsze zrozumienie intencji i stanu pasażera – takiego jak rozpoznawanie, kiedy ktoś jest w pośpiechu lub czuje się źle – AV mogą dostosować swoje zachowanie podczas jazdy, potencjalnie zmniejszając wypadki spowodowane nieporozumieniami lub dyskomfortem pasażerów.
Z perspektywy branży ta technologia mogłaby być kluczowym differentiatorem na konkurencyjnym rynku AV. Producentom, którzy mogą zaoferować bardziej intuicyjny i responsywny interfejs użytkownika, może uda się uzyskać znaczną przewagę.
Wyzwania i kierunki przyszłego rozwoju
Pomimo obiecujących wyników, pozostają jeszcze kilka wyzwań, zanim LLM-integrowane AV staną się rzeczywistością na drogach publicznych. Jednym z kluczowych problemów jest czas przetwarzania. Obecny system średnio zajmuje 1,6 sekundy, aby zinterpretować i zareagować na polecenie – co jest akceptowalne dla sytuacji niekrytycznych, ale potencjalnie problematyczne w sytuacjach wymagających szybkich reakcji.
Innym znaczącym problemem jest potencjał LLM do “halucynacji” lub błędnej interpretacji poleceń. Chociaż badanie uwzględniało mechanizmy bezpieczeństwa, aby zminimalizować to ryzyko, kompleksowe rozwiązanie tego problemu jest niezbędne do wdrożenia w świecie rzeczywistym.
W perspektywie przyszłej, zespół Wang bada kilka kierunków dalszych badań. Ewaluują oni inne LLM, w tym Gemini od Google i Llama AI od Meta, aby porównać ich wydajność. Wstępne wyniki sugerują, że ChatGPT obecnie przewyższa inne pod względem wskaźników bezpieczeństwa i efektywności, choć opublikowane wyniki są jeszcze w trakcie przygotowywania.
Jednym z interesujących kierunków rozwoju jest potencjał komunikacji między pojazdami przy użyciu LLM. Mogłoby to umożliwić bardziej zaawansowane zarządzanie ruchem, takie jak negocjowanie pierwszeństwa na skrzyżowaniach.
Ponadto, zespół rozpoczyna projekt badawczy nad dużymi modelami wizyjnymi – systemami AI szkolonymi na obrazach, a nie tekście – aby pomóc AV w nawigowaniu w skrajnych warunkach pogodowych, takich jak te spotykane w Midwest. To badanie, wspierane przez Centrum Połączonych i Zautomatyzowanych Transportów, mogłoby dalej poprawić adaptacyjność i bezpieczeństwo pojazdów autonomicznych.
Podsumowanie
Przełomowe badanie Purdue University dotyczące integracji dużych modeli językowych z pojazdami autonomicznymi stanowi przełomowy moment w technologii transportu. Poprzez umożliwienie bardziej intuicyjnej i responsywnej interakcji między ludźmi a AV, ta innowacja rozwiązuje krytyczne wyzwanie w przyjęciu AV. Chociaż pozostają przeszkody, takie jak czas przetwarzania i potencjalne błędne interpretacje, obiecujące wyniki badania otwierają drogę ku przyszłości, w której komunikacja z naszymi pojazdami mogłaby być tak naturalna, jak rozmowa z ludzkim kierowcą. W miarę ewolucji tej technologii, ma potencjał nie tylko zmienić, jak podróżujemy, ale także to, jak postrzegamy i interaktywnie korzystamy z sztucznej inteligencji w naszym codziennym życiu.












