Modele i platformy AI
Google DeepMind wprowadza tłumaczenie języka migowego na telefony z SL2T

Google DeepMind wprowadził model tłumaczący język migowy na tekst, SL2T, w dwóch produktach konsumenckich z systemem Android, co jest pierwszym razem, kiedy technologia języka migowego została wprowadzona do funkcji telefonu. Model umożliwia tłumaczenie języka migowego na tekst w aplikacjach Gboard i Live Transcribe na telefonach Pixel 11, które zostały uruchomione z tłumaczeniem języka migowego amerykańskiego na język angielski 12 sierpnia 2026 r.
Funkcja działa wszędzie, gdzie użytkownik normalnie wprowadza tekst. Osoba głucha może dyktować wyszukiwanie w sieci, tworzyć wiadomości lub dokumenty lub zadawać pytania Gemini, używając kamery telefonu zamiast klawiatury. W aplikacji Live Transcribe osoby głuche mogą odpowiadać w rozmowie migowej zamiast pisać. Google twierdzi, że testujący stwierdzili, że używanie języka migowego jest szybsze i bardziej naturalne niż pisanie po angielsku.
SL2T jest pierwszym modelem, który Google opisuje jako przełom w jakości i ogólności tłumaczenia języka migowego. Został on opracowany na podstawie ponad 100 000 godzin nagrań języka migowego, obejmujących ponad 50 języków migowych, z których około jednej czwartej danych to język migowy amerykański. Wspólne szkolenie modelu w różnych językach, dialektach i poziomach umiejętności spowodowało, że model przewyższa systemy jednego języka w eksperymentach przeprowadzonych przez firmę, jak podaje ogłoszenie.
Co model widzi i jak tłumaczy
System nie przetwarza surowego nagrania wideo osoby migającej. Model uruchamiany na urządzeniu, MediaPipe Holistic, śledzi 130 punktów na twarzy, ciele i rękach klatka po klatce, a tylko te współrzędne geometryczne opuszczają urządzenie w celu tłumaczenia. Oryginalne nagranie wideo jest od razu usuwane, co Google uważa za zabezpieczenie prywatności.
Z tego strumienia współrzędnych SL2T generuje tekst angielski bezpośrednio, pomijając pośrednią warstwę adnotacji zwaną glosami, na której opierały się większość poprzednich systemów tłumaczenia języka migowego. Glosy przypisują stałe etykiety do poszczególnych znaków, co ogranicza słownictwo i traci niemanualne markery i konstrukcje przestrzenne, które przenoszą znaczenie gramatyczne w językach migowych. Usunięcie tego wąskiego gardła pozwala na skalowanie jakości tłumaczenia wraz z danymi szkoleniowymi, a nie z zestawem ręcznie opracowanych etykiet.
Języki migowe są niezależnymi językami naturalnymi o własnej gramatyce, a nie wersjami języka mówionego. To sprawia, że zadanie jest tłumaczeniem między dwoma językami, a także trudnym problemem komputerowego widzenia: model musi śledzić jednoczesne ruchy rąk, ramion, tułowia, głowy i twarzy w wysokich szybkościach klatek. Wcześniejsze próby technologii języka migowego, takie jak rękawice sensoryczne, nie mogły rozwiązać żadnego z tych wymagań.
Wyniki benchmarkowe i pozostałe wzorce błędów
Na benchmarku FLEURS-ASL, który mierzy tłumaczenie języka migowego amerykańskiego na język angielski w warunkach studyjnych, SL2T uzyskuje wynik 70 BLEURT zero-shot, znacznie wyższy niż poprzednio zgłoszone wyniki, jak podaje Google. Firma również podaje wynik 74 BLEURT na wariant jednoręcznego podpisywania benchmarku i 85 BLEURT na zestawie danych PRESTO-ASL, który składa się z fraz asystenckich podpisywanych do dokowanego tabletu. Na FSboard, zestawie danych fingerspellingu zebranym od osób głuchych na urządzeniach mobilnych, model osiąga 64 procent dokładności dopasowania. Są to dane podane przez producenta; nie opublikowano niezależnej oceny.
Google opublikował przykłady z FLEURS-ASL, pokazując płynne dane wyjściowe obok identyfikowalnych trybów błędów. Model czasami zastępuje rzadkie znaki i szybkie fingerspelling, pomija konstrukcje bierne i przedstawienia klasyfikatorów, a także traci czas, gdy kontekst jest nieobecny. Jeden z przykładów tłumaczy “To w pełni upierzone, ciepłokrwiste ptactwo drapieżne” jako “To stworzenie jest ciepłokrwiste, je szare”, co jest błędem fingerspellingu, który zastępuje “szare” zamiast “drapieżne”.
Model wykazuje również resztkową tendencję do halucynacji, generując tekst, gdy nikt nie wykonuje znaków, na przykład gdy druga osoba wchodzi do kadru lub gdy osoba migająca pauzuje. Google twierdzi, że wersja wydania znacznie zmniejszyła te błędy w porównaniu z wersjami przedwydaniowymi, które testowali użytkownicy głusi w lipcu 2026 r., ale ich nie wyeliminowała.
Gdzie Google mówi, że narzędzie nie powinno być używane
Wydanie towarzyszy niezwykłej warstwie zarządzania. Google DeepMind utworzył komitet doradczy, Komitet Doradczy ds. Języka Migowego AI, który łączy organizacje głuche, w tym Narodowe Stowarzyszenie Głuchych, Światową Federację Głuchych, Sieć Sztuk Zawodowych Głuchych i Narodowy Instytut Techniczny dla Głuchych w Rochester Institute of Technology. Komitet współautorski sprawozdania wpływu, które określa, do czego służy ta technologia i gdzie się kończy.
Raport definiuje SL2T 1.0 jako pomocnicze narzędzie do generowania projektów w niskich stawkach, nieformalnych ustawieniach: wiadomości, wyszukiwania, nawigacji, notowania i nieformalnych rozmów jeden na jeden. Wyraźnie wyklucza konsultacje medyczne, postępowania sądowe, interakcje policyjne, instrukcje klasowe, rozmowy kwalifikacyjne i ustalenia świadczeń rządowych. Stwierdza również, że narzędzie nie spełnia obowiązków prawnych dotyczących rozsądnych dostosowań zgodnie z amerykańską ustawą o osobach niepełnosprawnych lub równoważnymi ramami, oraz że nie powinno być używane przez instytucje jako substytut certyfikowanych tłumaczy ludzkich.
Osoba migająca pozostaje w pętli na całym etapie. Obie aplikacje wyświetlają podgląd tekstu, który użytkownik może przeglądać i edytować przed wysłaniem, a w Live Transcribe osoba głucha kontroluje, kiedy przetłumaczony tekst jest wyświetlany partnerowi rozmawiającemu. Raport zauważa, że to zabezpieczenie zakłada funkcjonalną umiejętność czytania i pisania w języku angielskim, aby złapać błędy.
Jak SL2T działa w ramach ograniczeń modelu
Raport wpływu kataloguje techniczne granice modelu szczegółowo. Dokładność maleje w słabym świetle, ostrym podświetleniu lub gdy ubranie redukuje kontrast wobec rąk i twarzy. Śledzenie pozycji obiektu śledzi tylko największy obiekt w kadrze i nie może obsłużyć wielu osób migających. Występuje spadek wydajności przy ekstremalnych kątach kamery lub gdy osoba migająca leży na boku. Klipy wejściowe są ograniczone do 60 sekund, a każda klipka jest tłumaczona niezależnie, bez pamięci o poprzednich obrotach rozmowy. Model nie został przeszkolony ani oceniony na osobach poniżej 18 roku życia. Nie obsługuje niestandardowych list słów, znaków imion ani preferencji dialektów.
Bliskoterminowe aktualizacje już na mapie drogowej obejmują dyktowanie znaków interpunkcyjnych, nowych linii, emotikonów i podstawowych poleceń edycyjnych, a także pamięć rozmowy w sekwencji klipów w Live Transcribe. Długoterminowe cele badawcze obejmują lepszą wrażliwość na niemanualne markery, takie jak wyrażenia twarzy i pozycja brwi, obsługę wielu osób migających oraz rozszerzoną kolekcję danych w różnych dialektach języka migowego amerykańskiego i języka migowego czarnych Amerykanów.
Projekt powstał z inicjatywy Sama Sepaha, głuchego pracownika Google, a perspektywy głuchych zostały wbudowane w zbieranie danych, studia użytkowników i ocenę. Google opisuje uruchomienie SL2T jako początek dłuższych wysiłków: dodatkowe języki migowe, generowanie języka migowego i szersze możliwości graniczne są wszystkie wymienione jako prace w toku. Funkcja jest dostępna na telefonach Pixel 11 bez dodatkowych kosztów, a więcej urządzeń będzie dostępnych.












