AI 모델 및 플랫폼

구글 딥마인드, SL2T로 휴대폰에 수화 번역 기능을 제공

mm
Unite.AI를 Google의 선호 소스에 추가

Google DeepMind가 수어를 텍스트로 번역하는 SL2T 모델을 두 소비자용 Android 제품에 도입했습니다. 수어 AI가 실제 출시된 휴대폰 기능에 들어간 첫 사례입니다. Pixel 11 의 Gboard와 Live Transcribe에서 수어 입력을 지원하며, 2026년 8월 12일 미국수어(ASL)를 영어로 번역하는 기능으로 출시됐습니다.

평소 글자를 입력하는 곳이면 어디서나 쓸 수 있습니다. 농인 수어 사용자는 휴대폰 카메라에 수어를 해 웹 검색, 메시지·문서 작성, Gemini 질의를 입력할 수 있습니다. Live Transcribe에서는 글자를 번갈아 입력하는 대신 수어로 답할 수 있습니다. Google은 시험 사용자가 영어 타이핑보다 ASL 수어 입력을 더 빠르고 자연스럽다고 느꼈다고 설명합니다.

Google은 SL2T를 수어 번역의 품질과 범용성에 돌파구를 연 첫 모델로 설명합니다. 수어 50종 이상에 걸친 10만 시간 넘는 데이터로 학습했으며 약 4분의 1이 ASL입니다. 여러 언어·방언·숙련도를 함께 학습한 모델이 회사 실험에서 단일 언어 시스템을 능가했다는 발표입니다.

모델이 보는 정보와 번역 방식

번역 시스템은 수어 사용자의 원본 영상을 처리하지 않습니다. 기기에서 실행되는 MediaPipe Holistic이 얼굴·몸·손의 핵심 지점 130개를 프레임마다 추적하고 번역을 위해 기기 밖으로 나가는 것은 기하 좌표뿐입니다. 원본 카메라 영상은 즉시 폐기되며 Google은 이를 개인정보 보호 설계라고 설명합니다.

SL2T는 좌표 흐름에서 영어 텍스트를 직접 생성합니다. 기존 수어 번역 시스템 대부분이 의존한 글로스라는 중간 주석 단계를 생략합니다. 글로스는 개별 수어에 고정 표지를 붙여 어휘를 제한하고 문법 의미를 전달하는 비수지 신호와 공간 구성을 잃게 합니다. 이 병목을 없애면 사람이 만든 표지 집합 대신 학습 데이터 규모에 따라 번역 품질을 높일 수 있습니다.

수어는 영어를 손으로 표현한 것이 아니라 고유 문법을 가진 독립적인 자연언어입니다. 따라서 두 언어 사이의 기계 번역에 어려운 컴퓨터 비전 문제까지 더해집니다. 손·팔·몸통·머리·얼굴의 동시 움직임을 높은 프레임률로 추적해야 합니다. 센서 장갑 같은 과거 수어 기술 시도는 두 요건을 모두 해결하지 못했습니다.

벤치마크와 남아 있는 오류

FLEURS-ASL 벤치마크는 자격을 갖춘 농인 통역사가 스튜디오에서 기록한 복잡하고 추상적인 ASL을 영어로 번역하는 능력을 측정합니다. Google에 따르면 SL2T는 제로샷 BLEURT 70점으로 이전 보고 결과를 크게 웃돌았습니다. 한 손 수어 변형에서는 74점, 거치한 태블릿에 보조도구용 문구를 수어로 입력한 PRESTO-ASL에서는 85점을 보고했습니다. 농인 사용자가 모바일 기기로 제공한 지문자 데이터셋 FSboard의 정확 일치율은 64%입니다. 모두 공급업체 발표 수치이며 독립 평가는 공개되지 않았습니다.

Google은 FLEURS-ASL의 입력·출력 예시를 나란히 공개해 유창한 결과와 오류 양상을 보여 줬습니다. 드문 수어와 빠른 지문자를 다른 것으로 바꾸고, 수동태 구문·분류사 묘사를 빠뜨리며, 맥락이 없으면 시제를 잃는 경우가 있습니다. 한 예에서는 “깃털이 완전히 나고 온혈인 이 맹금류(This fully feathered, warm blooded bird of prey)”가 “이 생물은 온혈이고 회색을 먹는다(This creature is warm-blooded, eats grey)”로 번역됐습니다. 지문자에서 prey를 grey로 잘못 인식한 사례입니다.

다른 사람이 화면에 들어오거나 수어 사용자가 쉬는 등 아무도 수어를 하지 않을 때 텍스트를 만드는 환각도 남아 있습니다. Google은 출시판에서 2026년 7월 농인 평가자가 시험한 사전 버전보다 크게 줄였지만 완전히 없애지는 못했다고 설명합니다.

사용하면 안 되는 상황에 관한 지침

이번 출시에는 특이한 거버넌스 체계가 있습니다. DeepMind는 미국농인협회, 세계농인연맹, Deaf Professional Arts Network, 로체스터공대의 National Technical Institute for the Deaf 등 농인 단체가 참여하는 AI Sign Language Advisory Committee를 구성했습니다. 위원회는 공동 영향 보고서 를 함께 작성해 기술의 용도와 한계를 명시했습니다.

보고서는 SL2T 1.0을 메시지, 검색, 길 찾기, 메모, 일상적인 일대일 대화처럼 위험이 낮고 비공식적인 상황에서 초안을 만드는 보조도구로 규정합니다. 의료 상담, 법적 절차, 경찰과의 상호작용, 교실 수업, 취업 면접, 정부 혜택 결정에서는 사용하지 말라고 명시합니다. 미국 장애인법(ADA)이나 유사 제도의 합리적 편의 제공 의무를 충족하지 못하며, 기관이 자격을 갖춘 사람 통역사를 대신하는 용도로 사용해서는 안 된다고도 설명합니다.

수어 사용자는 전 과정에서 통제권을 유지합니다. 두 앱은 전송 전에 검토·수정할 텍스트 미리보기를 보여 주고, Live Transcribe에서는 농인 사용자가 대화 상대에게 번역문을 보여 줄 시점을 정합니다. 보고서는 이 안전장치가 오류를 찾아낼 실용적인 영어 문해력을 전제로 한다고 지적합니다.

자체 한계 문서가 설명하는 성능 제약

영향 보고서는 기술적 한계를 상세히 나열합니다. 어두운 곳, 강한 역광, 옷 때문에 손·얼굴의 대비가 낮아지는 상황에서 정확도가 떨어집니다. 자세 추적기는 화면에서 가장 크게 보이는 사람 하나만 따라가며 여러 수어 사용자를 처리하지 못합니다. 극단적인 카메라 각도나 옆으로 누운 자세에서도 성능이 낮아집니다. 입력은 60초로 제한되고 각 영상은 이전 대화를 기억하지 않고 따로 번역합니다. 18세 미만 사용자는 학습·평가 대상에 포함되지 않았습니다. 사용자 단어 목록, 이름수어, 방언 선호 설정도 지원하지 않습니다.

단기 로드맵에는 구두점·줄바꿈·이모지·기본 편집 명령의 입력과 Live Transcribe의 연속 영상 간 대화 기억이 포함됩니다. 장기 연구는 표정·눈썹 위치 같은 비수지 신호 인식 개선, 여러 수어 사용자 지원, 지역별 ASL 방언과 Black ASL 데이터 확대를 목표로 합니다.

프로젝트는 농인 Google 직원 샘 세파에게서 시작됐으며 데이터 수집, 사용자 연구, 평가에 농인의 관점을 반영했습니다. Google은 출시를 장기 노력의 시작으로 설명하며 추가 수어, 수어 생성, 더 폭넓은 첨단 능력을 현재 개발 중이라고 밝힙니다. Pixel 11에서 추가 비용 없이 제공되고 이후 다른 기기로 확대될 예정입니다.

Jonas Reeve는 Unite.AI에서 AI 생성 분석가로 활동하며 인지 AI, 인공 일반 지능(AGI) 및 기계 지능의 이론적 기반에 집중합니다. 그의 연구는 학습, 추론, 기억, 추상화가 생물학적 시스템과 인공 시스템 모두에서 어떻게 나타나는지를 탐구하고, 현대 AI 아키텍처와 인지 과학 및 마음 철학의 오랜 질문들 사이의 연결을 제시합니다.

개념적이고 반성적인 접근 방식을 통해 Jonas는 추론 모델, 에이전트 시스템, 발생 인지, 정렬 이론과 같은 프레임워크를 검토하며, AGI에 대한 진전이 실제로 의미하는 바와 의미하지 않는 바를 명확히 하고자 합니다. 일정이나 과대광고를 쫓기보다 그는 기본 원칙, 개념적 엄밀성, 그리고 현재 모델의 한계를 강조합니다.

Jonas Reeve가 작성한 기사들은 AI 생성이며, 정확성, 명확성 및 고급 AI 개념에 대한 책임 있는 논의를 보장하기 위해 Unite.AI 편집팀이 검토합니다.