Modelos y plataformas de IA

Google lleva asistencia visual en tiempo real a usuarios ciegos en Android

mm
Añade Unite.AI a tus fuentes preferidas en Google

Google lanzó Guided Vision en Gemini Live el 1 de octubre de 2026, una función de asistencia visual en tiempo real, controlada por voz, diseñada para personas ciegas, con baja visión o que desean asistencia visual intuitiva. Ahora está disponible en dispositivos Android con Android 9 o superior en las regiones e idiomas donde Gemini Live es compatible.

Google presentó por primera vez la función el 1 de septiembre de 2026, en su September Android Drop, donde Guided Vision se anunciaba como próximamente disponible para teléfonos con Android 9 o superior en los países donde Gemini está disponible. Esa vista previa describió las mismas descripciones compartidas de la cámara y la retroalimentación de voz para reencuadrar, e incluía una nota aclaratoria que la función puede cometer errores y no está destinada a ser un dispositivo médico, ayuda de movilidad, o sustituto de guías de viaje seguro, ni para navegación o detección de obstáculos.

Cómo funciona Guided Vision

Durante una sesión de Gemini Live, el usuario comparte la cámara del teléfono y Gemini proporciona descripciones habladas del entorno, responde preguntas de seguimiento detalladas y ofrece indicaciones verbales proactivas para centrar lo que el usuario quiera explorar. Si la cámara está apuntada demasiado alto, demasiado cerca o ligeramente descentrada, Gemini responde con indicaciones verbales naturales para reencuadrar — pidiendo al usuario que desplace lentamente la vista a la derecha, incline hacia abajo o retroceda hasta obtener el contexto visual claro que necesita para responder.

El anuncio, redactado por Isha Sheth, Gerente Senior de Producto de Gemini Live, describe Guided Vision como la transformación de Gemini en un compañero visual conversacional que se integra en las rutinas diarias con mínima fricción.

Desarrollado con Aira y la comunidad de accesibilidad

Google dijo que Guided Vision se desarrolló mediante una estrecha colaboración con la comunidad de accesibilidad. Para entrenar Gemini Live en contextos conversacionales y del mundo real, la compañía se asoció con Aira para interpretar visualmente datos durante decenas de miles de horas. Más de 1 000 miembros de la red de Probadores de Confianza de Aira ayudaron a someter a prueba y perfeccionar el modelo en rutinas diarias, y especialistas de Aira trabajaron directamente con los equipos de Google como expertos en la materia para establecer y evaluar salvaguardas de seguridad.

Sally Khoo, Subdirectora (Innovación) de SG Enable, dijo en el anuncio: “Como los teléfonos estándar suelen estar diseñados para usuarios videntes que pueden ver la pantalla, un producto como las descripciones visuales en tiempo real de Gemini Live con guía verbal proactiva de la cámara puede ayudar a cerrar una brecha crítica en las tareas cotidianas en el hogar, desde leer letra pequeña hasta localizar los elementos esenciales diarios.”

Según Google, la función refleja pruebas exhaustivas y retroalimentación de las comunidades de personas ciegas y con baja visión en India, Brasil, Singapur, Indonesia, Japón y otros países, recopiladas para que las descripciones, indicaciones de reencuadre y respuestas se sientan naturales y útiles.

Prashant Verma, de la National Association of the Blind, India, dijo en el mismo anuncio: “Probar estas capacidades directamente con usuarios ciegos y con baja visión en los diferentes idiomas indios garantiza que esta tecnología proporcione asistencia fiable y práctica en la vida cotidiana.”

Casos de uso cotidianos documentados

Google describió tareas cotidianas donde la verificación visual rápida es fundamental. Para leer letra pequeña y textos complejos, la compañía enumeró pequeñas etiquetas nutricionales en paquetes de alimentos, diales de electrodomésticos y ciclos de lavadoras, y menús impresos en restaurantes con poca luz. Para encontrar y localizar objetos, dio como ejemplos un auricular caído en el suelo y la pimienta negra dentro de una despensa de especias abarrotada. Para describir objetos y comparar detalles, los usuarios pueden preguntar sobre colores, patrones y formas, como comprobar si una camisa a rayas combina con un par de pantalones o identificar el color de una chaqueta específica. Para explorar el entorno inmediato, Guided Vision ofrece resúmenes descriptivos de espacios desconocidos, disposiciones de habitaciones o objetos colocados sobre una mesa.

Google dijo que Guided Vision admite conversaciones en varios idiomas y que, al igual que muchas innovaciones de accesibilidad, también brinda asistencia visual práctica para adultos mayores, personas con bajo nivel de alfabetización o cualquiera que intente leer letra pequeña con poca iluminación.

Rutas de acceso, disponibilidad y limitaciones declaradas

Los usuarios pueden acceder a la función a través de la aplicación Gemini, un acceso directo de Accesibilidad de Android o Google TalkBack. En la aplicación móvil Gemini, los usuarios abren la configuración del perfil y activan “Use Guided Vision in Live”, luego abren Gemini Live y tocan para compartir la cámara. En la Configuración de Android, dentro de Accesibilidad y luego Asistencia de visión, los usuarios pueden configurar un acceso directo de Accesibilidad para lanzar Guided Vision usando el botón flotante de accesibilidad, un gesto de deslizamiento con dos dedos o pulsando ambas teclas de volumen. Los usuarios que ejecutan Google TalkBack pueden abrir el menú TalkBack con un toque de tres dedos y seleccionar Guided Vision directamente.

Google afirma que Guided Vision es una herramienta de asistencia y puede cometer errores. La función no es un dispositivo médico, ayuda de movilidad o sustituto del bastón blanco, y no está destinada a la navegación, guía de viaje seguro o detección de obstáculos. Los usuarios deben seguir confiando en las ayudas de movilidad y prácticas de viaje seguro establecidas en entornos físicos.

Para comenzar, Google recomienda actualizar la aplicación Gemini y el software del sistema Android a las versiones más recientes.

Jonas Reeve es un analista generado por IA en Unite.AI, centrado en IA cognitiva, inteligencia artificial general (AGI) y los fundamentos teóricos de la inteligencia de máquinas. Su trabajo explora cómo el aprendizaje, el razonamiento, la memoria y la abstracción emergen tanto en sistemas biológicos como artificiales, estableciendo conexiones entre las arquitecturas de IA modernas y las preguntas históricas de la ciencia cognitiva y la filosofía de la mente.

Con un enfoque conceptual y reflexivo, Jonas examina marcos como modelos de razonamiento, sistemas agente, cognición emergente y teoría de alineación, con el objetivo de aclarar lo que realmente significa el progreso hacia la AGI —y lo que no significa. En lugar de perseguir cronogramas o exageraciones, él enfatiza los principios fundamentales, el rigor conceptual y los límites de los modelos actuales.

Los artículos escritos por Jonas Reeve son generados por IA y revisados por el equipo editorial de Unite.AI para garantizar precisión, claridad y una discusión responsable de conceptos avanzados de IA.