Modelos e plataformas de IA

Google traz assistência visual em tempo real para usuários cegos no Android

mm
Adicione Unite.AI às suas fontes preferidas no Google

Google lançou Guided Vision em Gemini Live em 1 de outubro de 2026, um recurso de assistência visual em tempo real, acionado por voz, desenvolvido para pessoas cegas, com baixa visão ou que desejam assistência visual intuitiva. Está agora disponível em dispositivos Android com Android 9 ou superior nas regiões e idiomas onde Gemini Live é suportado.

Google apresentou a prévia do recurso em 1 de setembro de 2026, em seu Lançamento Android de setembro, onde Guided Vision foi anunciado como chegando em breve a telefones com Android 9 ou superior nos países onde Gemini está disponível. Essa prévia descreveu as mesmas descrições compartilhadas pela câmera e o feedback de voz para reenquadramento, e incluiu uma nota de rodapé alertando que o recurso pode cometer erros e não se destina a ser um dispositivo médico, auxílio de mobilidade ou substituto de guias de viagem segura, nem para navegação ou detecção de obstáculos.

Como o Guided Vision funciona

Durante uma sessão do Gemini Live, o usuário compartilha a câmera do telefone e o Gemini fornece descrições faladas do ambiente, responde a perguntas detalhadas de acompanhamento e oferece indicações verbais proativas para centralizar o que o usuário deseja explorar. Se a câmera estiver apontada muito alto, muito perto ou ligeiramente para o lado, o Gemini responde com prompts verbais naturais para reenquadrar — pedindo ao usuário que deslize lentamente para a direita, incline para baixo ou dê um passo para trás até obter o contexto visual claro necessário para responder.

O anúncio, escrito por Isha Sheth, Gerente Sênior de Produto do Gemini Live, descreve o Guided Vision como transformar o Gemini em um parceiro visual conversacional que se encaixa nas rotinas diárias com o mínimo de atrito.

Desenvolvido com a Aira e a comunidade de acessibilidade

Google afirmou que o Guided Vision foi desenvolvido por meio de estreita colaboração com a comunidade de acessibilidade. Para treinar o Gemini Live em contextos conversacionais e do mundo real, a empresa fez parceria com a Aira para interpretar visualmente os dados por um total de dezenas de milhares de horas. Mais de 1.000 membros da rede de Testadores Confiáveis da Aira ajudaram a testar sob carga e refinar o modelo em rotinas diárias, e especialistas da Aira trabalharam diretamente com as equipes do Google como especialistas de assunto para estabelecer e avaliar salvaguardas de segurança.

Sally Khoo, Diretora Adjunta (Inovação) da SG Enable, disse no anúncio: “Como os telefones padrão são normalmente projetados para usuários com visão que podem ver a tela, um produto como as descrições visuais em tempo real do Gemini Live com orientação verbal proativa da câmera pode ajudar a preencher uma lacuna crítica nas tarefas cotidianas em casa, desde a leitura de letras pequenas até a localização de itens essenciais diários.”

Segundo o Google, o recurso reflete testes extensivos e feedback das comunidades de cegos e pessoas com baixa visão na Índia, Brasil, Cingapura, Indonésia, Japão e outros países, coletados para tornar as descrições, indicações de reenquadramento e respostas naturais e úteis.

Prashant Verma, da National Association of the Blind, Índia, disse no mesmo anúncio: “Testar essas capacidades diretamente com usuários cegos e com baixa visão em diferentes idiomas indianos garante que esta tecnologia ofereça assistência confiável e prática no cotidiano.”

Casos de uso cotidianos documentados

Google descreveu tarefas cotidianas em que a verificação visual rápida é mais importante. Para ler letras pequenas e textos complexos, a empresa citou rótulos nutricionais pequenos em embalagens de alimentos, botões de eletrodomésticos e ciclos de máquinas de lavar, além de cardápios impressos em restaurantes com iluminação fraca. Para encontrar e localizar objetos, deu como exemplos um fone de ouvido caído no chão e a pimenta preta dentro de um armário de especiarias lotado. Para descrever objetos e combinar detalhes, os usuários podem perguntar sobre cores, padrões e formas, como verificar se uma camisa listrada combina com uma calça ou identificar a cor de uma jaqueta específica. Para explorar o ambiente imediato, o Guided Vision fornece resumos descritivos de espaços desconhecidos, disposições de salas ou objetos colocados sobre uma mesa.

Google afirmou que o Guided Vision suporta conversas em vários idiomas e que, como muitas inovações de acessibilidade, também oferece assistência visual prática para idosos, pessoas com baixa alfabetização ou qualquer pessoa que tente ler letras pequenas em iluminação baixa.

Caminhos de acesso, disponibilidade e limitações declaradas

Os usuários podem acessar o recurso através do aplicativo Gemini, de um atalho de Acessibilidade do Android ou do Google TalkBack. No aplicativo móvel Gemini, os usuários abrem as configurações de perfil e ativam “Use Guided Vision in Live”, depois abrem o Gemini Live e tocam para compartilhar a câmera. Nas Configurações do Android, dentro de Acessibilidade e então Assistência de Visão, os usuários podem configurar um atalho de Acessibilidade para iniciar o Guided Vision usando o botão flutuante de acessibilidade, um gesto de deslizar com dois dedos ou pressionando ambas as teclas de volume. Usuários que utilizam o Google TalkBack podem abrir o menu TalkBack com um toque de três dedos e selecionar o Guided Vision diretamente.

Google afirma que o Guided Vision é uma ferramenta assistiva e pode cometer erros. O recurso não é um dispositivo médico, auxílio de mobilidade ou substituto da bengala branca, e não se destina à navegação, orientação de viagem segura ou detecção de obstáculos. Os usuários devem continuar a confiar em auxiliares de mobilidade estabelecidos e nas práticas de viagem segura em ambientes físicos.

Para começar, o Google recomenda atualizar o aplicativo Gemini e o software do sistema Android para as versões mais recentes.

Jonas Reeve é um analista gerado por IA na Unite.AI, focado em IA cognitiva, inteligência geral artificial (AGI) e nas fundações teóricas da inteligência de máquinas. Seu trabalho explora como aprendizado, raciocínio, memória e abstração surgem tanto em sistemas biológicos quanto artificiais, estabelecendo conexões entre arquiteturas modernas de IA e questões de longa data na ciência cognitiva e na filosofia da mente.

Com uma abordagem conceitual e reflexiva, Jonas examina estruturas como modelos de raciocínio, sistemas agentes, cognição emergente e teoria de alinhamento, visando esclarecer o que realmente significa o progresso rumo à AGI — e o que não significa. Em vez de perseguir cronogramas ou exageros, ele enfatiza princípios fundamentais, rigor conceitual e os limites dos modelos atuais.

Artigos escritos por Jonas Reeve são gerados por IA e revisados pela equipe editorial da Unite.AI para garantir precisão, clareza e discussão responsável de conceitos avançados de IA.