Modelos y plataformas de IA
Google DeepMind Lleva la Traducción del Lenguaje de Señas a los Teléfonos con SL2T

Google DeepMind ha lanzado un modelo de lenguaje de señas a texto, SL2T, dentro de dos productos de consumo de Android, la primera vez que la tecnología de lenguaje de señas ha alcanzado una característica de teléfono de envío. El modelo alimenta la dictación de señas a texto en Gboard y Live Transcribe en teléfonos Pixel 11, que se lanzan con la traducción de lenguaje de señas americano a inglés el 12 de agosto de 2026.
La función funciona en cualquier lugar donde normalmente se escribiría. Un sordo puede dictar una búsqueda en la web, redactar un mensaje o documento, o consultar a Gemini mediante señas a la cámara del teléfono en lugar de escribir. En Live Transcribe, los sordos pueden responder en conversación señalada en lugar de escribir hacia adelante y hacia atrás. Google dice que los probadores encontraron que señalar en ASL es más rápido y natural que escribir en inglés.
SL2T es el primer modelo que Google describe como un avance en calidad y generalidad para la traducción del lenguaje de señas. Fue entrenado con más de 100.000 horas de datos de señas que abarcan más de 50 lenguajes de señas, con aproximadamente una cuarta parte de los datos en ASL. El entrenamiento conjunto en varios lenguajes, dialectos y niveles de habilidad produjo un modelo que supera a los sistemas de un solo lenguaje en los experimentos de la empresa, según el anuncio.
Qué ve el modelo y cómo traduce
El sistema no procesa el video bruto del sordo. Un modelo en el dispositivo, MediaPipe Holistic, rastrea 130 puntos clave en la cara, el cuerpo y las manos, y solo esas coordenadas geométricas salen del dispositivo para la traducción. La alimentación original de la cámara se descarta inmediatamente, un diseño que Google presenta como una salvaguardia de privacidad.
Desde esa secuencia de coordenadas, SL2T genera texto en inglés directamente, saltando la capa intermedia de anotación conocida como glosas que la mayoría de los sistemas de traducción del lenguaje de señas anteriores dependían. Las glosas asignan etiquetas fijas a señas individuales, lo que limita el vocabulario y pierde los marcadores no manuales y las construcciones espaciales que llevan significado gramatical en los lenguajes de señas. Eliminar ese cuello de botella permite que la calidad de la traducción se escale con los datos de entrenamiento en lugar de con un conjunto de etiquetas construidas a mano.
Los lenguajes de señas son lenguajes naturales independientes con sus propias gramáticas, no versiones señalizadas del inglés hablado. Eso hace que la tarea sea la traducción automática entre dos lenguajes, más un problema de visión por computadora difícil: el modelo tiene que rastrear el movimiento simultáneo de las manos, los brazos, el torso, la cabeza y la cara a altas velocidades de cuadro. Los intentos anteriores de tecnología de lenguaje de señas, como los guantes de sensor, no podían abordar ninguno de los requisitos.
Resultados de referencia y patrones de error restantes
En el benchmark FLEURS-ASL, que mide la traducción de ASL a inglés de lenguaje abstracto complejo grabado en condiciones de estudio por intérpretes sordos certificados, SL2T obtiene 70 BLEURT zero-shot, bien por encima de los resultados informados anteriormente, según Google. La empresa también informa 74 BLEURT en una variante de señalización con una mano del benchmark y 85 BLEURT en PRESTO-ASL, un conjunto de datos de frases de asistente firmadas a una tableta anclada. En FSboard, un conjunto de datos de deletreo de dedos recopilado de sordos en dispositivos móviles, el modelo alcanza un 64 por ciento de precisión de coincidencia exacta. Estos son cifras informadas por el proveedor; no se ha publicado una evaluación independiente.
Google publicó ejemplos lado a lado de FLEURS-ASL que muestran una salida fluida junto con modos de error identificables. El modelo ocasionalmente sustituye señas raras y deletreo rápido, cae en construcciones pasivas y representaciones de clasificadores, y pierde el tiempo cuando falta el contexto. Un ejemplo traduce “Este pájaro de presa completamente emplumado, de sangre caliente” como “Esta criatura es de sangre caliente, come gris”, un error de deletreo que sustituye “gris” por “presa”.
El modelo también muestra un comportamiento residual de alucinación, generando texto cuando nadie está firmando, como cuando una segunda persona entra en el marco o el sordo se detiene. Google dice que la versión de lanzamiento redujo significativamente estos errores en comparación con las versiones previas a la versión que los evaluadores sordos probaron en julio de 2026, pero no los ha eliminado.
Dónde Google dice que no se debe usar la herramienta
El lanzamiento lleva una capa inusual de gobernanza. Google DeepMind convocó un comité asesor, el Comité Asesor de Lenguaje de Señas de IA, que reunió a organizaciones sordas, incluyendo la Asociación Nacional de Sordos, la Federación Mundial de Sordos, la Red de Artes Profesionales Sordas y el Instituto Nacional Técnico para Sordos de la Universidad de Rochester. El comité coescribió un informe de impacto conjunto que establece qué es la tecnología y dónde se detiene.
El informe define SL2T 1.0 como una herramienta de generación de borradores asistida para entornos informales de bajo riesgo: mensajería, búsqueda, navegación, toma de notas y conversaciones casuales de uno a uno. Regula explícitamente las consultas médicas, los procedimientos legales, las interacciones con la policía, la instrucción en el aula, las entrevistas de trabajo y las determinaciones de beneficios gubernamentales. También establece que la herramienta no satisface las obligaciones legales de adaptaciones razonables de la Ley de Estadounidenses con Discapacidades o marcos equivalentes, y que no debe usarse por instituciones para sustituir a intérpretes humanos certificados.
El sordo permanece en el bucle en todo momento. Ambas aplicaciones muestran una vista previa de texto que el usuario puede revisar y editar antes de enviar, y en Live Transcribe el usuario sordo controla cuándo se muestra el texto traducido a un compañero de conversación. El informe señala que esta salvaguardia supone una alfabetización funcional en inglés para detectar errores.
Cómo SL2T se desempeña en el documento de límites del modelo
El informe de impacto cataloga los límites técnicos del modelo en detalle. La precisión se degrada en condiciones de poca luz, iluminación de fondo dura o cuando la ropa reduce el contraste con las manos y la cara. El rastreador de postura sigue solo al sujeto más grande en el marco y no puede manejar varios sordos. El rendimiento disminuye en ángulos de cámara extremos o cuando el sordo se acuesta de lado. Los clips de entrada están limitados a 60 segundos, y cada clip se traduce de forma independiente, sin memoria de giros de conversación anteriores. El modelo no se entrenó ni evaluó en sordos menores de 18 años. No admite listas de palabras personalizadas, nombres de señas ni preferencias de dialecto.
Las actualizaciones a corto plazo ya están en la hoja de ruta, incluyendo la dictación de signos de puntuación, saltos de línea, emojis y comandos de edición básicos, además de la memoria de conversación en clips secuenciales en Live Transcribe. Los objetivos de investigación a largo plazo incluyen una mayor sensibilidad a los marcadores no manuales, como las expresiones faciales y la posición de las cejas, soporte para varios sordos y una mayor recopilación de datos en dialectos regionales de ASL y ASL negro.
El proyecto se originó con Sam Sepah, un sordo de Google, y las perspectivas sordas se integraron en la recopilación de datos, los estudios de usuarios y la evaluación. Google describe el lanzamiento de SL2T como el comienzo de un esfuerzo más largo: lenguajes de señas adicionales, generación de lenguaje de señas y capacidades de frontera más amplias están en la lista de trabajo activo. La función se envía en Pixel 11 sin costo adicional, con más dispositivos que seguirán.
El proyecto se enfoca en la recopilación de datos, los estudios de usuarios y la evaluación, con el objetivo de mejorar la calidad de la traducción y ampliar las capacidades del modelo. Google también está trabajando en la integración de SL2T con otros productos y servicios, como Google Assistant y Google Translate.
En resumen, SL2T es un modelo de lenguaje de señas a texto que puede traducir el lenguaje de señas americano a inglés en tiempo real. El modelo se entrenó con más de 100.000 horas de datos de señas y puede traducir texto en inglés directamente, sin necesidad de una capa intermedia de anotación. SL2T se puede utilizar en una variedad de aplicaciones, incluyendo la comunicación en tiempo real, la educación y el acceso a la información.












