Modelos e plataformas de IA
Google DeepMind Leva a Tradução de Língua de Sinais para Telefones com o SL2T

O Google DeepMind lançou um modelo de tradução de língua de sinais para texto, o SL2T, dentro de dois produtos de consumo Android, a primeira vez que a inteligência artificial de língua de sinais alcançou uma funcionalidade de telefone de remessa. O modelo alimenta a ditação de sinais para texto no Gboard e no Live Transcribe no Pixel 11 telefones, lançando com a tradução de Língua de Sinais Americana para Inglês em 12 de agosto de 2026.
A funcionalidade funciona em qualquer lugar onde um usuário normalmente digita. Um surdo pode ditar uma pesquisa na web, redigir uma mensagem ou documento, ou consultar o Gemini assinando para a câmera do telefone em vez de digitar. No Live Transcribe, os signatários podem responder em conversa assinada em vez de digitar para frente e para trás. O Google afirma que os testadores encontraram a assinatura em ASL mais rápida e mais natural do que digitar em inglês.
O SL2T é o primeiro modelo que o Google descreve como uma quebra de qualidade e generalidade para a tradução de língua de sinais. Foi treinado em mais de 100.000 horas de dados de assinatura que abrangem mais de 50 línguas de sinais, com cerca de um quarto dos dados em ASL. O treinamento conjunto em diferentes línguas, dialetos e níveis de proficiência produziu um modelo que supera os sistemas de uma única língua nos experimentos da empresa, de acordo com o anúncio.
O que o Modelo Vê e Como Traduz
O sistema não processa o vídeo bruto do signatário. Um modelo no dispositivo, MediaPipe Holistic, rastreia 130 pontos-chave no rosto, corpo e mãos quadro a quadro, e apenas essas coordenadas geométricas deixam o dispositivo para tradução. A alimentação de câmera original é descartada imediatamente, um design que o Google descreve como uma salvaguarda de privacidade.
A partir desse fluxo de coordenadas, o SL2T gera texto em inglês diretamente, pulando a camada intermediária de anotação conhecida como glosses que a maioria dos sistemas anteriores de tradução de língua de sinais dependia. As glosses atribuem rótulos fixos a sinais individuais, o que limita o vocabulário e perde os marcadores não manuais e construções espaciais que carregam significado gramatical nas línguas de sinais. Remover esse gargalo permite que a qualidade da tradução seja escalada com os dados de treinamento, em vez de com um conjunto de rótulos construído manualmente.
As línguas de sinais são línguas naturais independentes com suas próprias gramáticas, e não versões assinadas do inglês falado. Isso torna a tarefa uma tradução de máquina entre duas línguas, mais um problema de visão computacional difícil: o modelo tem que rastrear o movimento simultâneo das mãos, braços, torso, cabeça e rosto em taxas de quadros altas. As tentativas anteriores de tecnologia de língua de sinais, como luvas de sensor, não puderam abordar nenhum dos requisitos.
Resultados de Benchmark e Padrões de Erro Restantes
No benchmark FLEURS-ASL, que mede a tradução de ASL para inglês de linguagem complexa e abstrata gravada em condições de estúdio por Intérpretes Surdos Certificados, o SL2T obtém 70 BLEURT zero-shot, bem acima dos resultados relatados anteriormente, de acordo com o Google. A empresa também relata 74 BLEURT em uma variante de assinatura de uma mão do benchmark e 85 BLEURT no PRESTO-ASL, um conjunto de dados de frases de assistente assinadas para uma tablet acoplada. No FSboard, um conjunto de dados de fingerspelling coletado de signatários surdos em dispositivos móveis, o modelo atinge 64 por cento de precisão de correspondência exata. Esses são números relatados pelo fornecedor; nenhuma avaliação independente foi publicada.
O Google publicou exemplos lado a lado do FLEURS-ASL mostrando saída fluente ao lado de modos de falha identificáveis. O modelo ocasionalmente substitui sinais raros e fingerspelling rápido, dropa construções passivas e depictions de classificador, e perde o tempo quando o contexto está faltando. Um exemplo traduz “Este pássaro de rapina totalmente emplumado, de sangue quente” como “Esta criatura é de sangue quente, come cinza”, um erro de fingerspelling que substitui “cinza” por “rapina”.
O modelo também apresenta comportamento residual de alucinação, gerando texto quando ninguém está assinando, como quando uma segunda pessoa entra no quadro ou o signatário pausa. O Google afirma que a versão de lançamento reduziu significativamente esses erros em comparação com as compilações pré-lançamento que os avaliadores surdos testaram em julho de 2026, mas não os eliminou.
Onde o Google Diz que a Ferramenta Não Deve Ser Usada
O lançamento traz uma camada incomum de governança. O Google DeepMind convocou um comitê consultivo, o Comitê Consultivo de Língua de Sinais de IA, reunindo organizações surdas, incluindo a Associação Nacional dos Surdos, a Federação Mundial dos Surdos, a Rede de Artes Profissionais Surdas e o Instituto Nacional Técnico de Rochester para Surdos. O comitê co-autorou um relatório de impacto conjunto que define o que a tecnologia é e onde ela para.
O relatório define o SL2T 1.0 como uma ferramenta de geração de rascunho assistida para configurações informais de baixo risco: mensagens, pesquisa, navegação, tomada de notas e conversas casuais um a um. Ele explicitamente rejeita consultas médicas, procedimentos legais, interações com a polícia, instrução em sala de aula, entrevistas de emprego e determinações de benefícios do governo. Ele também afirma que a ferramenta não atende às obrigações legais para acomodações razoáveis sob a Lei dos Americanos com Deficiência ou estruturas equivalentes, e que não deve ser usada por instituições para substituir intérpretes humanos certificados.
O signatário permanece no loop ao longo do processo. Ambos os aplicativos mostram uma visualização de texto que o usuário pode revisar e editar antes de enviar, e no Live Transcribe o usuário surdo controla quando o texto traduzido é mostrado a um parceiro de conversa. O relatório observa que essa salvaguarda pressupõe alfabetização funcional em inglês para capturar erros.
Como o SL2T Desempenha no Documento de Limites do Modelo
O relatório de impacto cataloga os limites técnicos do modelo em detalhes. A precisão degrada em luz baixa, iluminação de fundo dura ou quando a roupa reduz o contraste contra as mãos e o rosto. O rastreador de pose segue apenas o assunto mais grande no quadro e não pode lidar com vários signatários. O desempenho cai em ângulos de câmera extremos ou quando o signatário está deitado. Os cliques de entrada são limitados a 60 segundos, e cada clipe é traduzido independentemente, sem memória de turnos de conversa anteriores. O modelo não foi treinado ou avaliado em signatários com menos de 18 anos. Ele não suporta listas de palavras personalizadas, sinais de nome ou preferências de dialeto.
Atualizações de curto prazo já estão no roadmap, incluindo a ditação de pontuação, novas linhas, emojis e comandos de edição básicos, além da memória de conversa em cliques sequenciais no Live Transcribe. Metas de pesquisa de longo prazo incluem melhor sensibilidade a marcadores não manuais, como expressões faciais e posição de sobrancelhas, suporte a vários signatários e expansão da coleta de dados em dialetos regionais de ASL e ASL Negro.
O projeto originou-se com Sam Sepah, um Googler surdo, e perspectivas surdas foram incorporadas à coleta de dados, estudos de usuário e avaliação. O Google descreve o lançamento do SL2T como o início de um esforço mais longo: línguas de sinais adicionais, geração de língua de sinais e capacidades de fronteira mais amplas estão todas listadas como trabalho ativo. A funcionalidade é enviada no Pixel 11 sem custo adicional, com mais dispositivos para seguir.
O Google descreve o lançamento do SL2T como o início de um esforço mais longo: línguas de sinais adicionais, geração de língua de sinais e capacidades de fronteira mais amplas estão todas listadas como trabalho ativo. A funcionalidade é enviada no Pixel 11 sem custo adicional, com mais dispositivos para seguir, para coleta de dados, estudos de usuário e avaliação.












