Моделі та платформи ШІ
Google DeepMind представляє переклад мови жестів на телефонах з SL2T

Google DeepMind випустив модель мови жестів до тексту, SL2T, всередині двох споживчих продуктів Android, вперше модель мови жестів досягла функції телефону. Модель забезпечує переклад жестів у текст у Gboard і Live Transcribe на Pixel 11 телефонах, запускається з американської мови жестів до англійської мови 12 серпня 2026 року.
Функція працює будь-де, де користувач звичайно друкує. Глухий користувач може диктувати веб-пошук, чернетку повідомлення або документа, або запитувати Gemini, жестами до камери телефону замість друкування. У Live Transcribe глухі користувачі можуть відповідати у жестовому діалозі замість друкування туди й назад. Google каже, що тестери знайшли жестування швидшим і більш природнім, ніж друкування англійською.
SL2T – це перша модель, яку Google описує як прорив у якості та загальності для перекладу мови жестів. Її тренували на понад 100 000 годинах жестових даних, що охоплюють понад 50 мов жестів, з приблизно чвертю даних у американській мові жестів. Тренування спільно по всіх мовах, діалектах та рівнях володіння створили модель, яка перевершує системи однієї мови в експериментах компанії, згідно з оголошенням.
Що бачить модель і як перекладає
Система не обробляє сире відео жестів. Модель на пристрої, MediaPipe Holistic, відстежує 130 ключових точок на обличчі, тілі та руках кадр за кадром, і тільки ці геометричні координати залишаються на пристрої для перекладу. Оригінальний камерний потік відразу викидається, що Google розглядає як захисний механізм конфіденційності.
Від того потоку координат SL2T генерує англійський текст безпосередньо, пропускаючи проміжній анотаційний шар, відомий як глоси, на який спиралися більшість попередніх систем перекладу мови жестів. Глоси призначують фіксовані мітки окремим жестам, що обмежує словниковий запас і втрачає немануальні маркери та просторові конструкції, які несуть граматичний сенс у мовах жестів. Видалення цього瓶ячка дозволяє якості перекладу зростати з тренувальними даними, а не з набором ручних міток.
Мови жестів – це незалежні природні мови зі своїми власними граматиками, а не жестові версії англійської мови. Це робить завдання машинним перекладом між двома мовами, плюс важкою комп’ютерною задачею: модель повинна відстежувати одночасний рух рук, рукавів, тулуба, голови та обличчя на високих кадрових швидкостях. Раніші спроби технології мови жестів, такі як сенсорні рукавички, не могли впоратися з жодним з цих вимог.
Результати бенчмарків та залишкові помилкові шаблони
На FLEURS-ASL бенчмарку, який вимірює переклад американської мови жестів до англійської мови складної, абстрактної мови, записаної в студійних умовах сертифікованими глухими тлумачами, SL2T набирає 70 BLEURT zero-shot, значно вище попередніх результатів, згідно з Google. Компанія також повідомляє про 74 BLEURT на одноручній версії бенчмарку та 85 BLEURT на PRESTO-ASL, наборі фраз-асистентів, жестових до докованої планшети. На FSboard, наборі даних жестового друкування, зібраному від глухих користувачів на мобільних пристроях, модель досягає 64 відсотків точної точності. Це цифри, звітувані виробником; жодної незалежної оцінки не опубліковано.
Google опублікував приклади з FLEURS-ASL, що демонструють плавний вивід поряд з ідентифікованими помилковими режимами. Модель іноді замінює рідкісні жести та швидке жестове друкування, пропускає пасивні конструкції та зображення класифікаторів, і втрачає часові форми, коли контекст відсутній. Один приклад перекладає “Ця повністю оперена, теплокровна пташка хижа” як “Ця істота теплокровна, їсть сіре”, помилка жестового друкування, що замінює “сіре” на “хижак”.
Модель також демонструє залишкові галюцинаційні поведінки, генеруючи текст, коли ніхто не жестує, наприклад, коли друга людина входить у кадр або жестувальник паузує. Google каже, що випускова версія значно знизила ці помилки порівняно з попередніми збірками, які глухі оцінювачі тестували у липні 2026 року, але не усунула їх.
Де Google каже, що інструмент не повинен бути використаний
Випуск містить незвичайний рівень управління. Google DeepMind створила консультативний орган, Комітет з питань мови жестів штучного інтелекту, який об’єднав глухі організації, включаючи Національну асоціацію глухих, Всесвітню федерацію глухих, Професійну мережу глухих мистецтв та Національний технічний інститут глухих у Рочестерському технологічному інституті. Комітет співавторував спільний звіт про вплив, який визначає, для чого призначена технологія та де вона зупиняється.
Звіт визначає SL2T 1.0 як допоміжний інструмент для генерації чернеток для низьких ставок, неформальних ситуацій: повідомлення, пошук, навігація, ведення нотаток та неформальні розмови один-до-одного. Він явно виключає медичні консультації, юридичні процедури, поліцейські взаємодії, класне навчання, співбесіди та визначення державних виплат. Він також зазначає, що інструмент не задовольняє юридичні зобов’язання щодо розумних умов для людей з обмеженими можливостями згідно з Законом про американців з обмеженими можливостями або еквівалентними рамками, і що його не слід використовувати установами для заміни сертифікованих людських тлумачів.
Гестувальник залишається у петлі на всіх етапах. Обидва додатки показують попередній перегляд тексту, який користувач може переглянути та відредагувати перед відправленням, а в Live Transcribe глухий користувач контролює, коли перекладений текст відображається співрозмовнику. Звіт зазначає, що цей захисний механізм припускає функціональну грамотність англійської мови для виявлення помилок.
Як SL2T працює у власному документі обмежень моделі
Звіт про вплив каталогізує технічні межі моделі детально. Точність погіршується при низькому освітленні, жорсткому проти-світлі або коли одяг зменшує контраст з руками та обличчям. Трекер пози слідує лише за найбільшим об’єктом у кадрі та не може оброблятиSeveral жестувальників. Продуктивність падає при екстремальних кутах камери або коли жестувальник лежить біч-о-біч. Вхідні кліпи обмежені 60 секундами, і кожен кліп перекладає незалежно, без пам’яті про попередні розмовні повороти. Модель не була тренована чи оцінена на жестувальниках молодших 18 років. Вона не підтримує жодних власних списків слів, жодних імен жестів та жодних переваг діалектів.
Ближчі оновлення вже на карті включають диктування пунктуації, нових рядків, емоджі та базових команд редагування, а також пам’ять розмови між послідовними кліпами у Live Transcribe. Довгострокові дослідницькі цілі включають кращу чутливість до немануальних маркерів, таких як вирази обличчя та положення брів, підтримку Several жестувальників та розширення збору даних по регіональним діалектам американської мови жестів та чорної мови жестів.
Проект походив від Сема Сепаха, глухого працівника Google, та глухих перспектив, закладених у збір даних, дослідження користувачів та оцінку. Google описує запуск SL2T як початок довшої роботи: додаткові мови жестів, генерація мови жестів та розширені можливості передової галузі перелічені як активна робота. Функція поставляється на Pixel 11 без додаткової плати, з більшими пристроями, які слідують.
Проект перейшов у стадію збору даних, дослідження користувачів та оцінки. Google описує запуск SL2T як початок довшої роботи: додаткові мови жестів, генерація мови жестів та розширені можливості передової галузі перелічені як активна робота. Функція поставляється на Pixel 11 без додаткової плати, з більшими пристроями, які слідують.












