Modele i platformy AI

Google wprowadza asystencję wizualną w czasie rzeczywistym dla osób niewidomych na Androidzie

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Google uruchomiło Guided Vision w Gemini Live 1 października 2026 r., funkcję asystencji wizualnej w czasie rzeczywistym, sterowaną głosem, przeznaczoną dla osób niewidomych, słabowidzących lub potrzebujących intuicyjnej pomocy wizualnej. Jest ona teraz dostępna na urządzeniach z Androidem 9 i nowszymi w regionach i językach, w których obsługiwane jest Gemini Live.

Google po raz pierwszy zaprezentowało tę funkcję 1 września 2026 r., w ramach wrześniowego Android Drop, gdzie Guided Vision został wymieniony jako wkrótce dostępny na telefonach z Androidem 9 i nowszymi w krajach, w których Gemini jest dostępny. Ta zapowiedź opisywała te same opisy udostępniane z kamery oraz głosowe informacje zwrotne dotyczące kadrowania, i zawierała przypis ostrzegający, że funkcja może popełniać błędy i nie jest przeznaczona jako urządzenie medyczne, pomoc w mobilności ani zamiennik bezpiecznych przewodników podróży, ani do nawigacji czy wykrywania przeszkód.

Jak działa Guided Vision

Podczas sesji Gemini Live użytkownik udostępnia kamerę telefonu, a Gemini dostarcza wypowiedziane opisy otoczenia, odpowiada na szczegółowe pytania uzupełniające i przekazuje proaktywne wskazówki głosowe, aby wyśrodkować to, co użytkownik chce zbadać. Jeśli kamera jest skierowana zbyt wysoko, zbyt blisko lub nieco na bok, Gemini reaguje naturalnymi poleceniami głosowymi, aby zmienić kadrowanie — prosząc użytkownika o powolne przesunięcie w prawo, przechylenie w dół lub cofnięcie się, aż uzyska wyraźny kontekst wizualny potrzebny do odpowiedzi.

Ogłoszenie, napisane przez Isha Sheth, starszą menedżerkę produktu Gemini Live, opisuje Guided Vision jako przekształcenie Gemini w konwersacyjnego partnera wizualnego, który wpasowuje się w codzienne rutyny przy minimalnym tarciu.

Opracowano we współpracy z Aira i społecznością dostępności

Google oświadczyło, że Guided Vision został opracowany w ścisłej współpracy ze społecznością dostępności. Aby wytrenować Gemini Live pod kątem konwersacyjnego, rzeczywistego kontekstu, firma nawiązała współpracę z Aira w celu wizualnej interpretacji danych przez łącznie dziesiątki tysięcy godzin. Ponad 1 000 członków sieci zaufanych testerów Aira pomogło w testach obciążeniowych i udoskonaleniu modelu w codziennych rutynach, a specjaliści Aira współpracowali bezpośrednio z zespołami Google jako eksperci tematyczni, aby ustanowić i ocenić zabezpieczenia bezpieczeństwa.

Sally Khoo, zastępca dyrektora (innowacje) w SG Enable, powiedziała w ogłoszeniu: „Ponieważ standardowe telefony są zazwyczaj projektowane dla użytkowników widzących, którzy mogą patrzeć na ekran, produkt taki jak opisane w czasie rzeczywistym wizualne opisy Gemini Live z proaktywnym głosowym prowadzeniem kamery może pomóc wypełnić krytyczną lukę w codziennych zadaniach w domu, od czytania drobnego druku po odnajdywanie niezbędnych przedmiotów codziennego użytku.”

Według Google, funkcja odzwierciedla rozległe testy i opinie społeczności niewidomych i słabowidzących w Indiach, Brazylii, Singapurze, Indonezji, Japonii i innych krajach, zebrane w celu uczynienia opisów, wskazówek kadrowania i odpowiedzi naturalnymi i pomocnymi.

Prashant Verma z National Association of the Blind, Indie, powiedział w tym samym ogłoszeniu: „Testowanie tych możliwości bezpośrednio z niewidomymi i słabowidzącymi użytkownikami w różnych językach indyjskich zapewnia, że technologia ta dostarcza niezawodną, praktyczną pomoc w codziennym życiu.”

Udokumentowane codzienne przypadki użycia

Google opisało codzienne zadania, w których szybka weryfikacja wizualna ma największe znaczenie. Do czytania drobnego druku i złożonych tekstów firma wymieniła małe etykiety żywieniowe na opakowaniach żywności, pokrętła urządzeń oraz cykle prania w pralce, a także drukowane menu w słabo oświetlonych restauracjach. Do znajdowania i lokalizowania przedmiotów podano przykłady upuszczonej słuchawki na podłodze oraz czarnego pieprzu wewnątrz zatłoczonej szafki z przyprawami. Do opisywania przedmiotów i dopasowywania szczegółów użytkownicy mogą pytać o kolory, wzory i kształty, na przykład sprawdzając, czy pasiasta koszula pasuje do pary spodni lub określając kolor konkretnej kurtki. Do eksploracji najbliższego otoczenia Guided Vision zwraca opisowe podsumowania nieznanych przestrzeni, układów pomieszczeń lub przedmiotów umieszczonych na stole.

Google stwierdziło, że Guided Vision obsługuje rozmowy w wielu językach i że, podobnie jak wiele innowacji dostępnościowych, zapewnia praktyczną pomoc wizualną dla osób starszych, osób o niskiej umiejętności czytania lub każdego, kto próbuje odczytać drobny druk w słabym oświetleniu.

Ścieżki dostępu, dostępność i wymienione ograniczenia

Użytkownicy mogą uzyskać dostęp do funkcji za pośrednictwem aplikacji Gemini, skrótu dostępności Androida lub Google TalkBack. W aplikacji mobilnej Gemini użytkownicy otwierają ustawienia profilu i włączają „Use Guided Vision in Live”, a następnie otwierają Gemini Live i dotykają, aby udostępnić kamerę. W ustawieniach Androida, w sekcji Dostępność, a potem Asysta wzrokowa, użytkownicy mogą skonfigurować skrót dostępności, aby uruchomić Guided Vision za pomocą pływającego przycisku dostępności, gestu przesunięcia dwoma palcami lub naciśnięcia obu przycisków głośności. Użytkownicy korzystający z Google TalkBack mogą wywołać menu TalkBack trzema palcami i wybrać Guided Vision bezpośrednio.

Google podkreśla, że Guided Vision jest narzędziem wspomagającym i może popełniać błędy. Funkcja nie jest urządzeniem medycznym, pomocą w mobilności ani zamiennikiem białej laski i nie jest przeznaczona do nawigacji, prowadzenia bezpiecznej podróży ani wykrywania przeszkód. Użytkownicy powinni nadal polegać na sprawdzonych pomocy w mobilności i praktykach bezpiecznej podróży w środowiskach fizycznych.

Aby rozpocząć, Google zaleca zaktualizowanie aplikacji Gemini oraz oprogramowania systemowego Android do najnowszych wersji.

Jonas Reeve jest analitykiem generowanym przez SI w Unite.AI, koncentrującym się na kognitywnej SI, sztucznej ogólnej inteligencji (AGI) oraz teoretycznych podstawach inteligencji maszynowej. Jego praca bada, jak uczenie się, rozumowanie, pamięć i abstrakcja wyłaniają się zarówno w systemach biologicznych, jak i sztucznych, tworząc powiązania między współczesnymi architekturami SI a długoletnimi pytaniami w naukach kognitywnych i filozofii umysłu.

Z koncepcyjnym i refleksyjnym podejściem Jonas bada ramy takie jak modele rozumowania, systemy agentowe, emergentna kognicja i teoria zgodności, dążąc do wyjaśnienia, co tak naprawdę oznacza postęp w kierunku AGI — a czego nie. Zamiast gonić za terminami czy hype’em, podkreśla pierwsze zasady, rygor konceptualny oraz ograniczenia obecnych modeli.

Artykuły autorstwa Jonasa Reeve są generowane przez SI i recenzowane przez zespół redakcyjny Unite.AI, aby zapewnić dokładność, przejrzystość i odpowiedzialną dyskusję zaawansowanych koncepcji SI.