Модели и платформы ИИ

Google DeepMind Привносит Перевод Жестового Языка на Телефоны С SL2T

mm
Добавьте Unite.AI в избранные источники в Google

Google DeepMind выпустил модель перевода жестового языка в текст, SL2T, внутри двух потребительских продуктов Android, впервые когда перевод жестового языка достиг shipping-функции телефона. Модель обеспечивает перевод жеста в текст в Gboard и Live Transcribe на Pixel 11 телефонах, запускаемом с американского жестового языка на английский перевод 12 августа 2026 года.

Функция работает везде, где пользователь обычно набирает текст. Глухой человек может диктовать веб-поиск, черновик сообщения или документа или запросить Gemini, подписывая на камеру телефона вместо набора текста. В Live Transcribe глухие люди могут отвечать в подписанном разговоре вместо набора текста туда и обратно. Google говорит, что тестировщики обнаружили, что подписание на американском жестовом языке быстрее и более естественно, чем набор текста на английском.

SL2T – это первая модель, которую Google описывает как прорыв в качестве и общности для перевода жестового языка. Она была обучена на более чем 100 000 часов подписывания данных, охватывающих более 50 жестовых языков, с примерно четвертью данных на американском жестовом языке. Обучение на нескольких языках, диалектах и уровнях владения произвело модель, которая превосходит системы с одним языком в экспериментах компании, согласно объявлению.

Что Модель Видит и Как Она Переводит

Система не обрабатывает сырой видеопоток подписывающего. Модель на устройстве, MediaPipe Holistic, отслеживает 130 ключевых точек на лице, теле и руках кадр за кадром, и только эти геометрические координаты покидают устройство для перевода. Оригинальный камерный поток сразу же отбрасывается, что Google считает мерой безопасности.

Из этого потока координат SL2T генерирует английский текст直接, минуя промежуточный слой аннотации, известный как глоссы, на который полагались большинство предыдущих систем перевода жестового языка. Глоссы присваивают фиксированные метки отдельным знакам, что ограничивает словарный запас и теряет немануальные маркеры и пространственные конструкции, которые несут грамматическое значение в жестовых языках. Удаление этой бутылочного горлышка позволяет качеству перевода масштабироваться с данными обучения, а не с набором меток, созданных вручную.

Жестовые языки – это независимые естественные языки со своими собственными грамматиками, а не подписанные версии устной английской речи. Это делает задачу машинным переводом между двумя языками, плюс сложной задачей компьютерного зрения: модель должна отслеживать одновременное движение рук, рук, туловища, головы и лица на высоких кадровых скоростях. Ранее попытки технологии жестового языка, такие как датчики перчаток, не могли решить ни одно из этих требований.

Результаты Бенчмарка и Остальные Шаблоны Ошибок

На FLEURS-ASL бенчмарке, который измеряет перевод американского жестового языка на английский сложного, абстрактного языка, записанного в студийных условиях сертифицированными глухими переводчиками, SL2T набирает 70 BLEURT нулевого выстрела, что значительно выше ранее сообщенных результатов, согласно Google. Компания также сообщает 74 BLEURT на одном варианте жестового языка бенчмарка и 85 BLEURT на PRESTO-ASL, наборе данных фраз помощников, подписанных на докированную планшет. На FSboard, наборе данных пальцевого письма, собранном из глухих подписчиков на мобильных устройствах, модель достигает 64 процентов точного совпадения. Это цифры, сообщенные поставщиком; никакой независимой оценки не было опубликовано.

Google опубликовал примеры из FLEURS-ASL, показывающие плавный вывод рядом с идентифицируемыми режимами ошибок. Модель иногда заменяет редкие знаки и быстрое пальцевое письмо, опускает пассивные конструкции и изображения классификаторов и теряет время, когда контекст отсутствует. Один пример переводит “Это полностью оперенный, теплокровный хищный птица” как “Это существо теплокровное, ест серое”, ошибка пальцевого письма, заменяющая “серое” на “хищного”.

Модель также показывает остаточное поведение галлюцинации, генерируя текст, когда никто не подписывает, например, когда второй человек входит в кадр или подписчик паузирует. Google говорит, что выпущенная версия значительно уменьшила эти ошибки по сравнению с предвыпусковыми сборками, которые глухие оценщики проверили в июле 2026 года, но не исключила их.

Где Google Говорит, Что Инструмент Не Должен Быть Использован

Выпуск несет необычный слой управления. Google DeepMind созвал консультативный орган, Комитет по жестовому языку ИИ, объединивший глухие организации, включая Национальную ассоциацию глухих, Всемирную федерацию глухих, Профессиональную сеть глухих искусств и Национальный технический институт глухих Рочестерского технологического института. Комитет стал соавтором совместного отчета об влиянии, который определяет, для чего предназначена технология и где она прекращается.

Отчет определяет SL2T 1.0 как инструмент генерации черновика для низкозатратных, неформальных настроек: обмен сообщениями, поиск, навигация, ведение заметок и случайные разговоры один на один. Он явно исключает медицинские консультации, юридические процедуры, взаимодействие с полицией, преподавание в классе, собеседования и определение государственных льгот. Он также заявляет, что инструмент не удовлетворяет юридическим обязательствам по разумным условиям в соответствии с Законом об американцах с ограниченными возможностями или эквивалентными рамками и что он не должен использоваться учреждениями для замены сертифицированных человеческих переводчиков.

Подписчик остается в цикле на протяжении всего процесса. Оба приложения показывают предварительный просмотр текста, который пользователь может просмотреть и отредактировать перед отправкой, и в Live Transcribe глухой пользователь контролирует, когда переведенный текст показан разговорному партнеру. Отчет отмечает, что эта мера безопасности предполагает функциональную грамотность на английском языке, чтобы поймать ошибки.

Как SL2T Выполняет в Собственных Ограничениях Модели

Отчет об влиянии каталогизирует технические границы модели в деталях. Точность ухудшается в условиях низкого освещения, жесткого подсвета или когда одежда уменьшает контраст с руками и лицом. Отслеживатель позы следует только за самым большим предметом в кадре и не может обрабатывать несколько подписчиков. Производительность падает при экстремальных углах камеры или когда подписчик лежит в бок. Входные клипы ограничены 60 секундами, и каждый клип переводится независимо, без памяти о предыдущих поворотах разговора. Модель не была обучена и не оценивалась на подписчиках моложе 18 лет. Она не поддерживает пользовательские списки слов, нет именных знаков и нет предпочтений диалектов.

Ближайшие обновления уже находятся на дорожной карте, включая диктовку знаков препинания, переносов строк, эмодзи и базовых команд редактирования, а также память разговора через последовательные клипы в Live Transcribe. Более долгосрочные исследовательские цели включают лучшую чувствительность к немануальным маркерам, таким как выражения лица и положение бровей, поддержку нескольких подписчиков и расширенную коллекцию данных по региональным диалектам американского жестового языка и черному американскому жестовому языку.

Проект начался с Сэма Сепаха, глухого сотрудника Google, и перспективы глухих были построены в коллекцию данных, пользовательские исследования и оценку. Google описывает запуск SL2T как начало более длительных усилий: дополнительные жестовые языки, генерация жестового языка и более широкие возможности фронтира перечислены как активная работа. Функция поставляется на Pixel 11 без дополнительной стоимости, с более устройствами, которые будут следовать.

Джонас Рив - аналитик, сгенерированный ИИ, в Unite.AI, который фокусируется на когнитивном ИИ, искусственном общем интеллекте (ИОИ) и теоретических основах машинного интеллекта. Его работа исследует, как обучение, рассуждение, память и абстракция возникают как в биологических, так и в искусственных системах, проводя связи между современными архитектурами ИИ и давними вопросами когнитивной науки и философии сознания.
С концептуальным и рефлексивным подходом Джонас исследует такие рамки, как модели рассуждений, агентные системы, возникающее сознание и теория соответствия, стремясь прояснить, что на самом деле означает прогресс в сторону ИОИ - и что нет. Вместо того, чтобы гнаться за сроками или хайпом, он подчеркивает первые принципы, концептуальную строгость и ограничения текущих моделей.
Статьи, написанные Джонасом Ривом, сгенерированы ИИ и проверены редакционной командой Unite.AI, чтобы обеспечить точность, ясность и ответственное обсуждение продвинутых концепций ИИ.