Ochrona zdrowia

Od przewidywania do odpowiedzialnych działań: projektowanie niepewności w Femtech AI

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google

W zdrowiu kobiet, dokładność jest konieczna, ale jest to tylko pierwsza warstwa bezpieczeństwa produktu. WaÅžne jest, aby system wiedział, kiedy przewidywanie jest wystarczająco silne, aby na niego działać, i jest zaprojektowany, aby powiedzieć, kiedy nie jest.

OtwÃģrz większość aplikacji do śledzenia płodności lub cyklu, a zobaczysz czysty wynik: owulacja w dniu 15, wysoki poziom płodności, wynik ufności 78%. Liczba wygląda na precyzyjną. Biologia pod nią nie jest.

Data miesiączki jest czymś, co uÅžytkownik obserwuje. Owulacja jest zjawiskiem ukrytym, ktÃģre Åžadne urządzenie konsumenckie nie mierzy bezpośrednio. Jest wnioskowana z pośrednich wskaÅšnikÃģw. Temperatura skÃģry odzwierciedla nie tylko poziom progesteronu, ale takÅže sen, alkohol, chorobę, warunki otoczenia i miejsce, w ktÃģrym czujnik był umieszczony tej nocy. Wprowadzony objaw łączy fizjologię z percepcją, pamięcią i decyzją uÅžytkownika o zalogowaniu go. Do momentu, gdy wszystko to rozwiązuje się w “Dzień 15, 78%”, kilka rÃģÅžnych rodzajÃģw niepewności zostało cicho skompresowanych w jedną pewną wypowiedÅš.

W produktach, nad ktÃģrymi pracowałem w dziedzinie zdrowia kobiet, trudnym problemem nie jest dokładność. Wzorcem, do ktÃģrego ciągle wracam, jest integralność decyzji. Dokładność mÃģwi, jak dobrze model przewiduje. Nie mÃģwi nic o tym, czy produkt wie, kiedy przewidywanie jest wystarczająco silne, aby na niego działać. W dziedzinie, w ktÃģrej ten sam wynik moÅže informować planowanie lub decyzję antykoncepcyjną, ta luka jest miejscem, w ktÃģrym zaufanie jest zdobywane lub tracone.

Moim argumentem jest więc to, Åže Femtech AI nie potrzebuje przede wszystkim lepszych przewidywań. Potrzebuje lepszego projektu niepewności. A projekt niepewności nie jest zastrzeÅženiem dołączonym przed uruchomieniem; jest to architektura. Strukturyzuję ją w sześciu warstwach, ktÃģre przenoszą sygnał od surowych danych wejściowych do działania, ktÃģre system moÅže uzasadnić i audytować. Stosuję sześciowarstwową wersję Metody Produktu Decyzji do Działania, zaprojektowaną w celu zarządzania tym, jak niepewne sygnały zdrowotne są konwertowane w dozwolone i odpowiedzialne działania. Metoda obejmuje kwalifikację danych, kalibrację inferencji, mapowanie konsekwencji, politykę kontroli, wykonanie przepływu pracy i pętlę odpowiedzialności. Jej ścieÅžka rządząca zaczyna się od danych zdrowotnych, ktÃģre prowadzą do architektury decyzji i kulminują w odpowiedzialnym działaniu.

1. Kwalifikuj dane przed zaufaniem im

Pierwsza warstwa decyduje, co system naprawdę wie. Produkty Femtech czerpią z bardzo rÃģÅžnych ÅšrÃģdeł. Mogą one obejmować rzeczy, ktÃģre uÅžytkownik bezpośrednio obserwuje, takie jak daty miesiączki lub subiektywne raporty, takie jak bÃģl lub nastrÃģj, a takÅže funkcje noszone, takie jak temperatura skÃģry i zmienność rytmu serca, oraz zmienne, ktÃģre model wygenerował sam. Traktowanie ich jako wymiennych danych wejściowych jest pierwotnym grzechem.

KaÅždy sygnał wymaga pochodzenia, ktÃģre system moÅže odczytać: skąd pochodzi, kiedy, jak często jest pobierany, co go zakłÃģca i jak się odnosi do rzeczy, ktÃģrą naprawdę przewidujesz. Owulacja jest zdarzeniem. Temperatura, śluz szyjkowy, LH i daty cyklu są dowodami na to zdarzenie, kaÅžde z własnym opÃģÅšnieniem i własnym błędem.

Brakujące dane zasługują na szczegÃģlną uwagę, poniewaÅž w śledzeniu zdrowia rzadko są losowe. Ludzie rejestrują się więcej, gdy są zaniepokojeni, i przestają, gdy czują się dobrze, więc luka moÅže zawierać tyle samo informacji, co wpis. W rzeczywistej analizie ponad 600 000 cykli owulacyjnych owulację nie moÅžna było wykryć w 665 603 z 1,4 miliona cykli początkowo branych pod uwagę. Trzy czwarte z nich miało waÅžne odczyty temperatury w mniej niÅž połowie dni cyklu. Wystarczalność danych była głÃģwnym czynnikiem ograniczającym to, co algorytm mÃģgł wnioskować. Produkt, ktÃģry emituje czysty etykietę płodności w tej sytuacji, nie jest pewny. Wytwarza precyzyjność, ktÃģrej nie posiada.

2. Kalibruj inferencję do dowodÃģw

Jeden wynik ufności nie moÅže reprezentować tego, co naprawdę się dzieje, poniewaÅž systemy te stają w obliczu kilku odrębnych ÅšrÃģdeł niepewności jednocześnie. Obejmują one biologiczną zmienność samego procesu, jakość pomiaru, brak danych z samoodpowiedzi, niepewność modelu z cienkich danych szkoleniowych i przesunięcie dystrybucji, gdy bieŞący uÅžytkownik nie przypomina populacji, na ktÃģrej model został zwalidowany.

W tej samej analizie tylko 13% cykli trwało dokładnie 28 dni, a średnia faza folikularna wynosiła 16,9 dni w zakresie wystarczająco szerokim, aby kaÅžde załoÅženie “dnia 14” było mylące. Badanie zdrowia kobiet Apple stwierdziło, Åže długość cyklu i zmienność wewnątrz osoby były związane z wiekiem, samooceną etniczną i indeksem masy ciała. Personalizacja nie moÅže oznaczać więc zamiany średniej populacyjnej na jeden punkt osobisty. Oznacza to wytworzenie dystrybucji, ktÃģra zacieśnia się wraz z gromadzeniem się dowodÃģw.

RozwaÅžmy dwa przewidywania oparte na sztucznej inteligencji, ktÃģre oba czytają “75%”. Jeden opiera się na roku historii i gęstych pomiarach, a jego niepewność jest głÃģwnie prawdziwą biologią. Drugi opiera się na dwÃģch cyklach, pięciu odczytach temperatury, niedawnym podrÃģÅžowaniu i nieznanym leczeniu. Tutaj niepewność jest głÃģwnie spowodowana brakiem danych. Taki sam numer. Produkt nie powinien być w stanie odpowiedzieć na nie w ten sam sposÃģb. To jest rÃģwnieÅž powodem, dla ktÃģrego kalibracja musi być sprawdzana w podgrupach – agregowana wydajność moÅže ukryć model, ktÃģry jest zbyt pewny, szczegÃģlnie dla nieregularnych cykli lub uÅžytkownikÃģw w okresie okołomenopauzalnym. Literatura kliniczna dotycząca sztucznej inteligencji oddziela dyskryminację, kalibrację i uÅžyteczność decyzji właśnie z tego powodu. Model moÅže dobrze klasyfikować uÅžytkownikÃģw i nadal wytwarzać błędne prawdopodobieństwa dla prawdziwych decyzji.

3. Mapuj konsekwencje błędu

Trzecia warstwa pyta, co się dzieje, gdy system jest błędny, i wiÄ…Åže dozwoloną odpowiedÅš z tym kosztem. Podsumowanie cyklu, szacunek okna płodności, etykieta niskiej płodności odczytywana jako porada antykoncepcyjna i interpretacja objawu, ktÃģra decyduje, czy ktoś szuka pomocy, nie są tym samym produktem, nawet gdy model za nimi jest identyczny.

Klasyfikuję dane wyjściowe w cztery poziomy według konsekwencji: informacyjne, behawioralne, reprodukcyjne i kliniczne. KaÅždy z nich ma własny prÃģg dowodÃģw, dozwoloną terminologię i ścieÅžkę eskalacji. Prawdopodobieństwo 70% moÅže być wystarczające do zgadnienia, kiedy okres się zacznie, i nie jest nawet blisko wystarczające, aby zapewnić komuś, Åže nie zajdzie w ciąŞę.

To jest miejsce, w ktÃģrym spotyka się projekt z regulacją. Czy oprogramowanie przechodzi w obszar urządzeń medycznych, zaleÅžy od jego przeznaczenia i roli, jaką jego dane wyjściowe odgrywają w decyzji zdrowotnej. Aktualne wytyczne FDA dotyczące oprogramowania wspierającego decyzje kliniczne, zaktualizowane w styczniu 2026 r., są explicite, Åže funkcje przeznaczone dla pacjentÃģw i opiekunÃģw mogą spełniać definicję urządzenia. Pozycjonowanie regulacyjne nie jest przeglądem prawnym na końcu. Jest zakodowane w Twoich progach, słownictwie i logice eskalacji od dnia pierwszego.

4. Przekształć niepewność w politykę kontroli

Powszechny “wyniki mogą być nieprecyzyjne” przekazuje cały problem interpretacji z powrotem do uÅžytkownika. Polityka kontroli robi coś przeciwnego. Dla danego stanu dowodÃģw decyduje, czy system wyświetla obserwację, oferuje ograniczony zakres, prosi o kolejne pomiary, wskazuje na klinicystę czy odmawia odpowiedzi. WstrzemięŚliwość jest moÅžliwością produktu, a nie awarią. “Nie jesteśmy jeszcze pewni” powinno być zaprojektowanym stanem z następnym krokiem, a nie ekranem błędu.

Konkretnie, zamiast “Owulacja: Dzień 15, 78% ufności”, odpowiedÅš zarządzana brzmi bliÅžej tego: owulacja jest najprawdopodobniej w ciągu czterodniowego okna; ufność jest ograniczona przez brakujące dane temperatury i zaburzony sen; kilka więcej odczytÃģw mogłoby udoskonalić szacunek, a test LH mÃģgłby dodać perspektywiczne dowody i zawęzić prawdopodobne okno. UÅžytkownik otrzymuje szacunek, powÃģd, dla ktÃģrego jest on niepewny, i jedną akcję, ktÃģra mogłaby to zmienić.

5. Wspieraj działanie, ktÃģre wynika z danych wyjściowych

Nawet aplikacja konsumencka tworzy przepływ pracy: zaloguj kolejne odczyty, powtÃģrz test, kontynuuj obserwację, wyeksportuj dane, skontaktuj się z klinicystą. System powinien wiedzieć, jaką akcję kaÅžda odpowiedÅš wskazuje, i czy moÅže ją wspierać bezpiecznie.

Granica między poradami produktu a poradami medycznymi leÅžy tutaj, i nie jest to ustalona linia. Treści edukacyjne wyjaśniające, co sygnał ogÃģlnie oznacza, mieszczą się bezpiecznie po stronie porad. Produkt przechodzi w obszar wyÅžszego ryzyka, gdy interpretuje dane jednej osoby jako chorobę, kieruje leczeniem lub oferuje zapewnienie, ktÃģre ma realną wagę kliniczną. Ta granica musi być utrzymana przy kaÅždej interakcji, a nie tylko w warunkach usługi.

6. Zamknij pętlę odpowiedzialności

Ostatnia warstwa ocenia cały system, a nie tylko model. Standardowe metryki modelu nadal mają znaczenie i koncentrują się na dyskryminacji, kalibracji, wydajności podgrup, walidacji zewnętrznej i czasowej. Ale metryki poziomu produktu mają rÃģwnie wielkie znaczenie. Powinniśmy spytać, jak często system miał wystarczające dane wejściowe, aby działać, jak często wstrzymywał się. Plus jeden, na ktÃģry naciskam, to wskaÅšnik fałszywego zapewnienia, czyli jak często powiedział komuś, Åže wszystko wygląda dobrze na podstawie dowodÃģw, ktÃģre nie mogłyby wesprzeć twierdzenia.

KaÅžda konsekwencja odpowiedzi powinna być moÅžliwa do odtworzenia po fakcie. Regulatorzy, organy standaryzacji i instytucje zarządzania zdrowiem na całym świecie coraz częściej przyjmują ten punkt widzenia cyklu Åžycia. Zasady dobrej praktyki maszynowego uczenia się IMDRF traktują godne zaufania urządzenia medyczne AI jako pełną odpowiedzialność cyklu Åžycia, obejmującą projekt, wdroÅženie i monitorowanie, co powtarza wytyczne WHO dotyczące AI dla zdrowia.

Jak wygląda architektura w praktyce

Powiedzmy, Åže produkt ma trzy miesiące dat cyklu, sześć nocy temperatury, jeden pozytywny test LH, kilka wpisÃģw objawÃģw i tydzień złego snu. NajwyÅžsze prawdopodobieństwo owulacji modelu pada na dzień 15. Aplikacja z szacunkiem punktowym wyświetla “Owulacja: Dzień 15, 78% ufności”.

Architektura wytwarza coś innego. Oznacza dane temperatury jako rzadkie i zakłÃģcone snem. Generuje dystrybucję na kilka kandydujących dni zamiast jednego. Stosuje łagodny prÃģg dla świadomości cyklu, ale surowszy, jeśli dane wyjściowe dotykają zapobiegania ciÄ…Åžy. Oferuje zakres plus następne przydatne pomiary. I przechowuje cały stan dowodÃģw, aby decyzja mogła być pÃģÅšniej odtworzona. Ten sam podstawowy model i zupełnie inny produkt.

Prawo do działania

Systemy Femtech są coraz bardziej wzbogacone w dane, z aplikacjami, noszonymi urządzeniami, testami domowymi, rekordami medycznymi i warstwami konwersacyjnymi ułoÅžonymi na gÃģrze. Więcej danych moÅže udoskonalić inferencję, ale takÅže rozszerza powierzchnię fałszywej precyzyjności. Zespoły, ktÃģre zdobędą zaufanie, nie będą tymi z najczystszym wynikiem ufności. Będą tymi, ktÃģrych produkty wiedzą, czego nie wiedzą, i są zaprojektowane, aby to powiedzieć.

Dokładność opisuje jakość przewidywania. Integralność decyzji decyduje, czy produkt zdobył prawo do działania na jej podstawie.

Mariia Kulikovskaia jest specjalistą ds. strategii produktÃģw związanych z danymi zdrowotnymi, pracującym w obszarze produktÃģw zdrowotnych, środowiskowych i technologicznych wykorzystujących sztuczną inteligencję. Jej praca obejmuje strategię produktÃģw B2B dla systemÃģw monitorowania środowiska i produktÃģw analitycznych zgodnych z przepisami zdrowotnymi.