AI 모델 및 플랫폼
구글 딥마인드, SL2T로 휴대폰에 수화 번역 기능을 제공

구글 딥마인드는 두 개의 소비자 안드로이드 제품에 수화-텍스트 모델인 SL2T를 출시했습니다. 이는 수화 인공지능이 출하된 휴대폰 기능에 도달한 최초의 사례입니다. 이 모델은 Gboard와 Live Transcribe에서 수화-텍스트 입력을 구동하며, 픽셀 11 휴대폰에서 미국 수화 언어를 영어로 번역하는 기능을 시작으로 2026년 8월 12일에 출시되었습니다.
이 기능은 사용자가 일반적으로 입력하는 모든 곳에서 작동합니다. 청각 장애인 사용자는 웹 검색, 메시지 또는 문서 작성, 또는 젬니에게 수화로 휴대폰 카메라에 입력할 수 있습니다. 라이브 트랜스라이브에서 수화 사용자는 입력 대신 수화로 대화에 응답할 수 있습니다. 구글은 테스터들이 영어 입력보다 미국 수화 언어로 입력하는 것이 더 빠르고 더 자연스럽다고发现했습니다.
SL2T는 구글이 수화 번역의 품질과 일반성에 대한 돌파구로 설명하는 최초의 모델입니다. 이는 50개 이상의 수화 언어에 걸쳐 10만 시간 이상의 수화 데이터로 훈련되었으며, 데이터의 약 4분의 1은 미국 수화 언어입니다. 언어, 방언, 숙련 度를跨으로 훈련하면 회사 실험에서 단일 언어 시스템을 능가하는 모델이 생성됩니다. 이는 공식 발표에 따르면 vậy입니다.
모델이 볼 수 있는 것과 번역하는 방법
시스템은 수화者的 원시 비디오를 처리하지 않습니다. 온-디바이스 모델인 MediaPipe Holistic은 얼굴, 몸, 손의 130개 키 포인트를 프레임별로 추적하며, 기하학적 좌표만 디바이스에서 번역을 위해 나갑니다. 원본 카메라 피드는 즉시 폐기되며, 구글은 이를 개인 정보 보호 수단으로 설명합니다.
그 좌표 스트림에서 SL2T는 중간 어노테이션 레이어인 글로스를 거치지 않고 직접 영어 텍스트를 생성합니다. 글로스는 개별 수화에 고정 레이블을 할당하며, 이는 어휘를 제한하고 수화 언어에서 문법적 의미를 전달하는 비수동 마커와 공간적 구성이 손실됩니다. 이러한 병목 현상을 제거하면 번역 품질이 레이블 세트와 함께 훈련 데이터와 함께 확장할 수 있습니다.
수화 언어는 구어 영어의 수화 버전이 아닌 독립된 자연 언어로, 자신의 문법을 가지고 있습니다. 이는 두 언어 간의 기계 번역과 어려운 컴퓨터 비전 문제입니다. 모델은 높은 프레임 속도로 손, 팔, 몸통, 머리, 얼굴의 동시적인 움직임을 추적해야 합니다. 이전의 수화 기술 시도는 이러한 요구를 충족할 수 없었습니다.
벤치마크 결과와 남은 오류 패턴
FLEURS-ASL 벤치마크에서, 이는 인증된 수화 통역사가 스튜디오 환경에서 녹음한 복잡한 추상 언어를 영어로 번역하는 것을 측정합니다. SL2T는 70 BLEURT 제로샷을 달성하며, 이전에 보고된 결과보다 훨씬 높습니다. 구글은 또한 벤치마크의 일손 수화 변형에서 74 BLEURT와 도킹된 태블릿으로 수화된 보조 스타일 문구 데이터 세트인 PRESTO-ASL에서 85 BLEURT를 달성했다고 보고합니다. 모바일 디바이스에서 수집된 수화 데이터 세트인 FSboard에서 모델은 64%의 정확한 일치도를 달성합니다. 이는 벤더 보고된 수치이며, 독립적인 평가가 발표되지 않았습니다.
구글은 FLEURS-ASL에서 유창한 출력과 식별 가능한 실패 모드를 보여주는 예시를 발표했습니다. 모델은 때때로 드문 수화와 빠른 손가락 수화, 수동 구문과 분류자 묘사를 삭제하며, 문맥이 없으면 시제를 잃습니다. 한 예에서는 “이 완전히 깃털이 달린, 따뜻한 피를 가진 조류”를 “이 생물은 따뜻한 피를 가지고 있으며, 회색을 먹는다”로 번역하며, 손가락 수화 오류로 “prey”를 “회색”으로 바꿉니다.
모델은 또한 잔여적인 환상 행동을 보여주며, 아무도 수화하지 않을 때 텍스트를 생성합니다. 예를 들어, 두 번째 사람이 프레임에 들어가거나 수화자가 일시정지할 때입니다. 구글은 출시 버전이 2026년 7월에 데프 평가자들이 테스트한 사전 출시 빌드와 비교하여 이러한 오류를 크게 줄였다고 말하지만, 완전히 제거하지는 못했습니다.
구글이 도구를 사용해서는 안 되는 곳
이 출시에는异常な 거버넌스 레이어가 있습니다. 구글 딥마인드는 수화 언어 자문위원회를 구성했으며, 이는 데프 단체를 포함하여 국가 데프 협회, 세계 데프 연맹, 데프 프로페셔널 아트 네트워크, 로체스터 기술 및 공과 대학의 국가 기술 연구소 등을 포함합니다. 위원회는 공동 영향 보고서를 공동으로 작성했으며, 이는 기술이 무엇인지와 어디서 중단하는지에 대해 설명합니다.
보고서는 SL2T 1.0을 낮은 위험도의 비공식적인 환경에서 사용하기 위한 보조 초안 생성 도구로 정의합니다. 여기에는 메시징, 검색, 탐색, 메모 작성, 캐주얼한 1:1 대화가 포함됩니다. 이는 의료 상담, 법적 절차, 경찰 상호작용, 교실 수업, 취업 면접, 정부 혜택 결정에서 사용할 수 없다고 명시적으로 규정합니다. 또한 이 도구는 미국 장애인법 또는 동등한 프레임워크下的 합리적인 편의 제공에 대한 법적 의무를 충족하지 못하며, 기관은 인증된 인간 통역자를 대신해서 사용해서는 안 된다고 규정합니다.
수화자는 전체 과정을 통해 루프에 있습니다. 두 애플리케이션 모두 사용자가 검토하고 편집할 수 있는 텍스트 미리보기를 표시하며, 라이브 트랜스라이브에서 데프 사용자는 대화 상대방에게 번역된 텍스트가 표시되는 시기를 제어합니다. 보고서는 이 안전 장치는 기능적인 영어 문해력을 가정하며, 오류를 잡을 수 있다고 언급합니다.
SL2T 모델의 한계 문서에서 모델의 성능
영향 보고서는 모델의 기술적 경계를 자세히 설명합니다. 정확도는 낮은 조도, 강한 백라이트, 또는 의류가 손과 얼굴에 대한 대조를 줄일 때 저하됩니다. 포즈 추적기는 프레임 안에서 가장 큰 주제만을 추적하며, 여러 수화자를 처리할 수 없습니다. 성능은 극단적인 카메라 각도 또는 수화자가 옆으로 누워 있을 때 저하됩니다. 입력 클립은 60초로 제한되며, 각 클립은 이전 대화 턴에 대한 기억 없이 독립적으로 번역됩니다. 모델은 18세 미만의 수화자를 대상으로 훈련하거나 평가하지 않았습니다. 사용자 지정 단어 목록, 이름 수화, 또는 방언 선호도를 지원하지 않습니다.
근시안 업데이트에는 구두점, 줄 바꿈, 이모티콘, 기본 편집 명령어의 입력이 포함되며, 라이브 트랜스라이브에서 순차적인 클립 간의 대화 메모리가 포함됩니다. 장기 연구 목표에는 비수동 마커와 같은 얼굴 표정 및眉毛 위치에 대한 감도 향상, 다중 수화자 지원, 지역 미국 수화 방언 및 블랙 미국 수화에 대한 데이터 수집 확대가 포함됩니다.
이 프로젝트는 데프 구글러인 샘 세파에서 시작되었습니다. 데프 관점은 데이터 수집, 사용자 연구, 평가에 통합되었습니다. 구글은 SL2T의 출시를 더 긴 노력의 시작으로 설명합니다. 추가 수화 언어, 수화 생성, 더 넓은 프론티어 기능이 모두 활성화된 작업으로 나열됩니다. 이 기능은 픽셀 11에서 추가 비용 없이 제공되며, 더 많은 디바이스가 뒤따를 것입니다.
into data collection, user studies, and evaluation. Google describes SL2T’s launch as the beginning of a longer effort: additional sign languages, sign language generation, and broader frontier capabilities are all listed as active work. The feature ships on Pixel 11 at no additional cost, with more devices to follow.












