Модели и платформы ИИ
Машина LLM: прорыв в общении между человеком и автономным транспортным средством

По мере того, как автономные транспортные средства (АТС) приближаются к широкому внедрению, остается значительная проблема: мост между общением человеческих пассажиров и их роботизированными шоферами. Хотя АТС сделали замечательные шаги в навигации по сложным дорожным условиям, они часто испытывают трудности в интерпретации нюансов, естественных языковых команд, которые так легко даются человеческим водителям.
Вступает в действие инновационное исследование из школы гражданского и строительного инженерного дела Лайлса Университета Пердью. Под руководством помощника профессора Зирана Вана команда инженеров разработала инновационный подход к улучшению взаимодействия между человеком и АТС с помощью искусственного интеллекта. Их решение заключается в интеграции больших языковых моделей (БЯМ) типа ChatGPT в автономные системы вождения.
Власть естественного языка в АТС
БЯМ представляют собой скачок вперед в способности ИИ понимать и генерировать текст, похожий на человеческий. Эти сложные системы ИИ обучены на огромных объемах текстовых данных, что позволяет им понимать контекст, нюансы и подразумеваемые значения способами, которые традиционные запрограммированные ответы не могут.
В контексте автономных транспортных средств БЯМ предлагают трансформирующую возможность. В отличие от традиционных интерфейсов АТС, которые полагаются на конкретные голосовые команды или кнопочные входы, БЯМ могут интерпретировать широкий спектр естественных языковых инструкций. Это означает, что пассажиры могут общаться со своими транспортными средствами так же, как они бы общались с человеческим водителем.
Улучшение возможностей общения АТС значительное. Представьте, что вы говорите своей машине: “Я опаздываю”, и она автоматически рассчитывает наиболее эффективный маршрут, корректируя свой стиль вождения, чтобы безопасно минимизировать время путешествия. Или рассмотрите возможность сказать: “Я чувствую себя немного укачиваемым”, что приводит к тому, что транспортное средство корректирует свой профиль движения для более гладкой поездки. Эти нюансовые взаимодействия, которые человеческие водители интуитивно понимают, становятся возможными для АТС благодаря интеграции БЯМ.

Помощник профессора Университета Пердью Зиран Ван стоит рядом с тестовым автономным транспортным средством, которое он и его студенты оснастили для интерпретации команд от пассажиров с помощью ChatGPT или других больших языковых моделей. (Фото Университета Пердью/Джон Андервуд)
Исследование Пердью: методология и результаты
Чтобы проверить потенциал БЯМ в автономных транспортных средствах, команда Пердью провела серию экспериментов, используя транспортное средство уровня четыре автономии – всего лишь один шаг от полной автономии, определенной Международной ассоциацией автомобильных инженеров.
Исследователи начали с обучения ChatGPT реагировать на ряд команд, от прямых инструкций типа “Пожалуйста, езжайте быстрее” до более косвенных просьб, таких как “Я чувствую себя немного укачиваемым сейчас”. Затем они интегрировали эту обученную модель с существующими системами транспортного средства, позволяя ей учитывать такие факторы, как правила дорожного движения, состояние дорог, погода и данные с датчиков при интерпретации команд.
Экспериментальная установка была строгой. Большинство тестов проводились на полигоне в Колумбусе, Индиана – бывшей взлетно-посадочной полосе аэропорта, которая позволяла проводить безопасные высокоскоростные испытания. Дополнительные парковочные испытания были проведены на парковке стадиона Росс-Эйд Университета Пердью. На протяжении всего эксперимента ЛЯМ-ассистированное АТС реагировало на как предуčenые, так и новые команды от пассажиров.
Результаты были перспективными. Участники сообщили о значительно более низких уровнях дискомфорта по сравнению с типичными опытом в АТС уровня четыре без помощи ЛЯМ. Транспортное средство последовательно превосходило базовые показатели безопасности и комфорта, даже когда реагировало на команды, на которые оно не было явно обучено.
Возможно, наиболее впечатляющим является то, что система продемонстрировала способность учиться и адаптироваться к индивидуальным предпочтениям пассажиров в течение поездки, что показывает потенциал для真正 персонализированного автономного транспорта.

Аспирант Университета Пердью Кан Цуй сидит на поездке в тестовом автономном транспортном средстве. Микрофон в консоли принимает его команды, которые большие языковые модели в облаке интерпретируют. Транспортное средство едет в соответствии с инструкциями, сгенерированными из больших языковых моделей. (Фото Университета Пердью/Джон Андервуд)
Последствия для будущего транспорта
Для пользователей преимущества многочисленны. Способность общаться естественно с АТС снижает кривую обучения, связанную с новой технологией, что делает автономные транспортные средства более доступными для более широкого круга людей, включая тех, кто может быть запуган сложными интерфейсами. Кроме того, возможности персонализации, продемонстрированные в исследовании Пердью, предполагают будущее, где АТС могут адаптироваться к индивидуальным предпочтениям, предоставляя адаптированный опыт для каждого пассажира.
Это улучшенное взаимодействие также может повысить безопасность. Благодаря лучшему пониманию намерений и состояния пассажира – например, распознаванию, когда кто-то спешит или чувствует себя плохо – АТС могут корректировать свое поведение при вождении соответственно, потенциально снижая количество аварий, вызванных недоразумением или дискомфортом пассажиров.
С точки зрения отрасли эта технология может стать ключевым дифференциатором на конкурентном рынке АТС. Производители, которые могут предложить более интуитивно понятный и отзывчивый пользовательский опыт, могут получить значительное преимущество.
Проблемы и будущие направления
Несмотря на перспективные результаты, остаются несколько проблем, прежде чем АТС с интегрированными ЛЯМ станут реальностью на общественных дорогах. Одной из ключевых проблем является время обработки. Текущая система в среднем занимает 1,6 секунды, чтобы интерпретировать и отреагировать на команду – приемлемо для некритических сценариев, но потенциально проблематично в ситуациях, требующих быстрых реакций.
Другой значительной проблемой является потенциал для ЛЯМ “галлюцинировать” или неправильно интерпретировать команды. Хотя исследование включало механизмы безопасности для смягчения этого риска, комплексное решение этой проблемы имеет решающее значение для реального внедрения.
Взглянув вперед, команда Вана исследует несколько направлений для дальнейших исследований. Они оценивают другие ЛЯМ, включая помощников ИИ Gemini от Google и Llama от Meta, чтобы сравнить производительность. Предварительные результаты показывают, что ChatGPT в настоящее время превосходит другие в показателях безопасности и эффективности, хотя опубликованные результаты будут представлены позже.
Одним из интригующих будущих направлений является потенциал для межтранспортного общения с помощью ЛЯМ. Это может позволить более сложное управление трафиком, например, когда АТС договариваются о праве проезда на перекрестках.
Кроме того, команда приступает к проекту по изучению больших моделей зрения – систем ИИ, обученных на изображениях, а не на тексте – чтобы помочь АТС ориентироваться в экстремальных зимних погодных условиях, распространенных на Среднем Западе. Это исследование, поддерживаемое Центром подключенного и автоматизированного транспорта, может еще больше повысить адаптивность и безопасность автономных транспортных средств.
Основная мысль
Прорывное исследование Университета Пердью по интеграции больших языковых моделей с автономными транспортными средствами знаменует собой поворотный момент в технологии транспорта. Позволяя более интуитивно понятное и отзывчивое взаимодействие между человеком и АТС, это инновация решает критическую проблему внедрения АТС. Хотя остаются препятствия, такие как скорость обработки и потенциальные неправильные интерпретации, перспективные результаты исследования открывают путь к будущему, где общение с нашими транспортными средствами может быть так же естественным, как разговор с человеческим водителем. По мере того, как эта технология развивается, она имеет потенциал революционизировать не только то, как мы путешествуем, но и то, как мы воспринимаем и взаимодействуем с искусственным интеллектом в нашей повседневной жизни.












