Модели и платформы ИИ

Google предоставляет визуальную помощь в реальном времени слепым пользователям на Android

mm
Добавьте Unite.AI в избранные источники в Google

Google запустил Guided Vision в Gemini Live 1 октября 2026 г., функцию визуальной помощи в реальном времени, управляемую голосом, созданную для людей, которые слепы, имеют пониженное зрение или хотят интуитивную визуальную поддержку. Сейчас она доступна на устройствах Android с Android 9 и выше в регионах и на языках, где поддерживается Gemini Live.

Google впервые представил функцию 1 сентября 2026 г. в рамках September Android Drop, где Guided Vision была указана как скоро появится на телефонах с Android 9 и выше в странах, где доступен Gemini. В этом предварительном обзоре описывались те же описания, передаваемые с камеры, и голосовая обратная связь для переориентирования, а также была примечание, предостерегающее, что функция может допускать ошибки и не предназначена как медицинское устройство, средство передвижения или замена руководств по безопасному перемещению, а также не предназначена для навигации или обнаружения препятствий.

Как работает Guided Vision

Во время сеанса Gemini Live пользователь делится камерой телефона, а Gemini предоставляет устные описания окружающего, отвечает на детальные последующие вопросы и дает проактивные голосовые подсказки, чтобы сосредоточить то, что пользователь хочет исследовать. Если камера направлена слишком высоко, слишком близко или слегка в сторону, Gemini отвечает естественными голосовыми подсказками для переориентирования — прося пользователя медленно переместить камеру вправо, наклонить её вниз или отойти назад, пока не будет получен чёткий визуальный контекст, необходимый для ответа.

В объявлении, написанном Иша Шет, старшим менеджером продукта Gemini Live, Guided Vision описывается как превращающая Gemini в разговорного визуального партнёра, который без труда вписывается в повседневные задачи.

Разработано совместно с Aira и сообществом доступности

Google заявила, что Guided Vision была разработана в тесном сотрудничестве с сообществом доступности. Чтобы обучить Gemini Live для разговорного, реального контекста, компания сотрудничала с Aira для визуальной интерпретации данных в течение десятков тысяч часов. Более 1 000 участников сети проверенных тестеров Aira помогли провести стресс‑тестирование и доработку модели в рамках ежедневных задач, а специалисты Aira работали напрямую с командами Google в качестве экспертов, чтобы установить и оценить меры безопасности.

Салли Кху, заместитель директора (инновации) в SG Enable, заявила в объявлении: «Поскольку стандартные телефоны обычно разрабатываются для зрячих пользователей, которые видят экран, продукт, такой как визуальные описания в реальном времени Gemini Live с проактивным голосовым управлением камерой, может помочь устранить критический разрыв в повседневных задачах дома, от чтения мелкого шрифта до поиска необходимых предметов».

По словам Google, функция отражает обширные тестирования и обратную связь от сообществ слепых и людей с пониженным зрением в Индии, Бразилии, Сингапуре, Индонезии, Японии и других странах, собранные для того, чтобы описания, подсказки по переориентированию и ответы ощущались естественно и полезно.

Прашант Верма из National Association of the Blind, Индия, сказал в том же объявлении: «Тестирование этих возможностей непосредственно с пользователями‑слепыми и людьми с пониженным зрением на разных индийских языках гарантирует, что эта технология предоставляет надёжную, практическую помощь в повседневной жизни».

Задокументированные сценарии повседневного использования

Google описала повседневные задачи, где быстрая визуальная проверка имеет наибольшее значение. Для чтения мелкого шрифта и сложного текста компания привела в пример небольшие пищевые этикетки, циферблаты бытовой техники и программы стирки, а также печатные меню в слабо освещённых ресторанах. Для поиска и локализации предметов были приведены примеры упавшего на пол наушника и черного перца внутри переполненного специи шкафа. Для описания предметов и сопоставления деталей пользователи могут спрашивать о цветах, узорах и формах, например, проверять, сочетается ли в полоску рубашка с парой брюк, или определять цвет конкретного пиджака. Для изучения непосредственного окружения Guided Vision предоставляет описательные обзоры незнакомых пространств, планов комнат или предметов, размещённых на столе.

Google заявила, что Guided Vision поддерживает беседы на нескольких языках и, как и многие инновации в области доступности, также предоставляет практическую визуальную помощь пожилым людям, людям с низким уровнем грамотности или тем, кто пытается прочитать мелкий шрифт при плохом освещении.

Пути доступа, доступность и заявленные ограничения

Пользователи могут получить доступ к функции через приложение Gemini, ярлык доступности Android или Google TalkBack. В мобильном приложении Gemini пользователи открывают настройки профиля и включают «Use Guided Vision in Live», затем открывают Gemini Live и нажимают, чтобы поделиться камерой. В настройках Android, в разделе Доступность → Помощь зрения, пользователи могут настроить ярлык доступности для запуска Guided Vision с помощью плавающей кнопки доступности, жеста swipe двумя пальцами или нажатием обеих клавиш громкости. Пользователи, использующие Google TalkBack, могут вызвать меню TalkBack тройным касанием и напрямую выбрать Guided Vision.

Google утверждает, что Guided Vision является вспомогательной утилитой и может допускать ошибки. Функция не является медицинским устройством, средством передвижения или заменой белой трости и не предназначена для навигации, руководства безопасным перемещением или обнаружения препятствий. Пользователям следует продолжать использовать проверенные средства передвижения и практики безопасного перемещения в реальной среде.

Чтобы начать, Google советует обновить приложение Gemini и системное программное обеспечение Android до последних версий.

Jonas Reeve является аналитиком, созданным ИИ, в Unite.AI, специализирующимся на когнитивном ИИ, искусственном общем интеллекте (AGI) и теоретических основах машинного интеллекта. Его работа исследует, как обучение, рассуждение, память и абстракция возникают как в биологических, так и в искусственных системах, устанавливая связи между современными архитектурами ИИ и давними вопросами когнитивной науки и философии разума.

Подходя концептуально и рефлексивно, Jonas исследует такие рамки, как модели рассуждения, агентные системы, возникшее познание и теория выравнивания, стремясь прояснить, что на самом деле означает прогресс в направлении AGI — и чего он не означает. Вместо того чтобы гнаться за сроками или ажиотажем, он подчеркивает фундаментальные принципы, концептуальную строгость и ограничения текущих моделей.

Статьи, написанные Jonas Reeve, генерируются ИИ и проверяются редакционной командой Unite.AI, чтобы обеспечить точность, ясность и ответственное обсуждение передовых концепций ИИ.