Моделі та платформи ШІ

Google впроваджує візуальну допомогу в режимі реального часу для користувачів Android з порушенням зору

mm
Додайте Unite.AI до бажаних джерел у Google

Google запустив Guided Vision у Gemini Live 1 жовтня 2026 року, функцію візуальної допомоги в режимі реального часу, керовану голосом, створену для людей, які сліпі, мають низьке зір або шукають інтуїтивну візуальну підтримку. Тепер вона доступна на пристроях Android з Android 9 і вище в регіонах та мовах, де підтримується Gemini Live.

Google вперше продемонстрував цю функцію 1 вересня 2026 року у своєму September Android Drop, де Guided Vision було зазначено як майбутню функцію для телефонів з Android 9 і вище в країнах, де доступний Gemini. У цьому прев’ю було описано ті ж самі описи, що діляться камерою, і голосовий зворотний зв’язок для переналаштування кадру, а також містив примітку, що функція може помилятись і не призначена як медичний пристрій, засіб мобільності чи заміна безпечних навігаційних підказок, а також не призначена для навігації чи виявлення перешкод.

Як працює Guided Vision

Під час сеансу Gemini Live користувач ділиться камерою телефону, а Gemini надає голосові описи оточення, відповідає на детальні уточнюючі питання та дає проактивні вербальні підказки, щоб сфокусувати те, що користувач хоче дослідити. Якщо камера спрямована занадто високо, занадто близько або трохи збоку, Gemini реагує природними голосовими підказками для переналаштування кадру — пропонуючи користувачеві повільно перемістити камеру вправо, нахилити її вниз або відійти назад, доки не отримає чіткий візуальний контекст, необхідний для відповіді.

У оголошенні, написаному Іша Шет, старшим менеджером продукту Gemini Live, Guided Vision описується як перетворення Gemini у розмовного візуального партнера, який без зайвих зусиль вписується у щоденні рутинні завдання.

Розроблено спільно з Aira та спільнотою доступності

Google заявив, що Guided Vision була розроблена у тісній співпраці зі спільнотою доступності. Щоб навчити Gemini Live до розмовного, реального контексту, компанія співпрацювала з Aira, яка візуально інтерпретувала дані протягом десятків тисяч годин. Понад 1 000 учасників мережі Trusted Tester від Aira допомогли провести стрес‑тестування та вдосконалити модель у різних щоденних сценаріях, а спеціалісти Aira працювали безпосередньо з командами Google як експерти‑предметники, щоб встановити та оцінити безпечні межі.

Sally Khoo, заступник директора (інновації) у SG Enable, заявив у анонсі: “Оскільки стандартні телефони зазвичай створені для користувачів, які бачать екран, продукт, такий як реальні візуальні описи Gemini Live з проактивним голосовим керуванням камерою, може допомогти подолати критичний розрив у повсякденних завданнях вдома, від читання дрібного шрифту до пошуку щоденних необхідних предметів.”

За словами Google, функція відображає масштабне тестування та зворотний зв’язок від спільнот сліпих та людей з низьким зором у Індії, Бразилії, Сінгапурі, Індонезії, Японії та інших країнах, зібрані з метою зробити описи, підказки щодо переналаштування кадру та відповіді природними та корисними.

Prashant Verma з National Association of the Blind, India, заявив у тому ж анонсі: “Тестування цих можливостей безпосередньо з користувачами з порушенням зору та слабозорими користувачами різних індійських мов забезпечує, що ця технологія надає надійну, практичну допомогу в повсякденному житті.”

Документовані приклади щоденного використання

Google описав щоденні завдання, у яких швидка візуальна перевірка є найважливішою. Для читання дрібного шрифту та складного тексту компанія навела приклади маленьких етикеток з харчовою інформацією на упаковках, регуляторів приладів та циклів пральних машин, а також друкованих меню у слабо освітлених ресторанах. Для пошуку та локалізації предметів були наведені приклади випадкового навушника на підлозі та чорного перцю в переповненій спеційній шафі. Для опису предметів та підбору деталей користувачі можуть запитати про кольори, візерунки та форми, наприклад, перевірити, чи смугаста сорочка підходить до штанів, або визначити колір конкретної куртки. Для дослідження безпосереднього оточення Guided Vision надає описові огляди незнайомих просторів, планувань кімнат або предметів, розташованих на столі.

Google зазначив, що Guided Vision підтримує розмови багатьма мовами і, як і багато інновацій у сфері доступності, також забезпечує практичну візуальну допомогу для літніх людей, осіб з низьким рівнем грамотності або будь-кого, хто намагається читати дрібний шрифт при низькому освітленні.

Шляхи доступу, доступність та заявлені обмеження

Користувачі можуть отримати доступ до функції через додаток Gemini, ярлик доступності Android або Google TalkBack. У мобільному додатку Gemini користувачі відкривають налаштування профілю та вмикають “Use Guided Vision in Live”, потім відкривають Gemini Live і натискають, щоб поділитися камерою. У налаштуваннях Android, у розділі Доступність, а потім Допомога зору, користувачі можуть налаштувати ярлик доступності для запуску Guided Vision за допомогою плаваючої кнопки доступності, жесту свайпу двома пальцями або натискання обох клавіш гучності. Користувачі, які користуються Google TalkBack, можуть викликати меню TalkBack трьома пальцями та безпосередньо вибрати Guided Vision.

Google стверджує, що Guided Vision є допоміжною утилітою і може помилитися. Функція не є медичним пристроєм, засобом мобільності чи заміною білої палиці, і не призначена для навігації, безпечного супроводу під час подорожей чи виявлення перешкод. Користувачі повинні й надалі покладатися на встановлені засоби мобільності та практики безпечного переміщення у фізичному середовищі.

Щоб розпочати, Google радить оновити додаток Gemini та системне програмне забезпечення Android до останніх версій.

Jonas Reeve є аналітиком, створеним штучним інтелектом, у Unite.AI, зосередженим на когнітивному ШІ, штучному загальному інтелекті (AGI) та теоретичних основах машинного інтелекту. Його робота досліджує, як навчання, міркування, пам’ять і абстракція виникають як у біологічних, так і в штучних системах, встановлюючи зв’язки між сучасними архітектурами ШІ та довготривалими питаннями когнітивної науки та філософії розуму.

З концептуальним та рефлексивним підходом Jonas досліджує такі рамки, як моделі міркування, агентні системи, емерджентна когніція та теорія вирівнювання, прагнучи уточнити, що насправді означає прогрес у напрямку AGI — і що це не означає. Замість того, щоб гонитись за терміновими датами чи гіпом, він наголошує на фундаментальних принципах, концептуальній суворості та межах поточних моделей.

Статті, написані Jonas Reeve, створені штучним інтелектом і перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне обговорення передових концепцій ШІ.