Ochrona zdrowia
Od przewidywania do odpowiedzialnych działań: projektowanie niepewności w Femtech AI

W zdrowiu kobiet, dokładność jest konieczna, ale jest to tylko pierwsza warstwa bezpieczeństwa produktu. Ważne jest, aby system wiedział, kiedy przewidywanie jest wystarczająco silne, aby na niego działać, i jest zaprojektowany, aby powiedzieć, kiedy nie jest.
Otwórz większość aplikacji do śledzenia płodności lub cyklu, a zobaczysz czysty wynik: owulacja w dniu 15, wysoki poziom płodności, wynik ufności 78%. Liczba wygląda na precyzyjną. Biologia pod nią nie jest.
Data miesiączki jest czymś, co użytkownik obserwuje. Owulacja jest zjawiskiem ukrytym, które żadne urządzenie konsumenckie nie mierzy bezpośrednio. Jest wnioskowana z pośrednich wskaźników. Temperatura skóry odzwierciedla nie tylko poziom progesteronu, ale także sen, alkohol, chorobę, warunki otoczenia i miejsce, w którym czujnik był umieszczony tej nocy. Wprowadzony objaw łączy fizjologię z percepcją, pamięcią i decyzją użytkownika o zalogowaniu go. Do momentu, gdy wszystko to rozwiązuje się w “Dzień 15, 78%”, kilka różnych rodzajów niepewności zostało cicho skompresowanych w jedną pewną wypowiedź.
W produktach, nad którymi pracowałem w dziedzinie zdrowia kobiet, trudnym problemem nie jest dokładność. Wzorcem, do którego ciągle wracam, jest integralność decyzji. Dokładność mówi, jak dobrze model przewiduje. Nie mówi nic o tym, czy produkt wie, kiedy przewidywanie jest wystarczająco silne, aby na niego działać. W dziedzinie, w której ten sam wynik może informować planowanie lub decyzję antykoncepcyjną, ta luka jest miejscem, w którym zaufanie jest zdobywane lub tracone.
Moim argumentem jest więc to, że Femtech AI nie potrzebuje przede wszystkim lepszych przewidywań. Potrzebuje lepszego projektu niepewności. A projekt niepewności nie jest zastrzeżeniem dołączonym przed uruchomieniem; jest to architektura. Strukturyzuję ją w sześciu warstwach, które przenoszą sygnał od surowych danych wejściowych do działania, które system może uzasadnić i audytować. Stosuję sześciowarstwową wersję Metody Produktu Decyzji do Działania, zaprojektowaną w celu zarządzania tym, jak niepewne sygnały zdrowotne są konwertowane w dozwolone i odpowiedzialne działania. Metoda obejmuje kwalifikację danych, kalibrację inferencji, mapowanie konsekwencji, politykę kontroli, wykonanie przepływu pracy i pętlę odpowiedzialności. Jej ścieżka rządząca zaczyna się od danych zdrowotnych, które prowadzą do architektury decyzji i kulminują w odpowiedzialnym działaniu.
1. Kwalifikuj dane przed zaufaniem im
Pierwsza warstwa decyduje, co system naprawdę wie. Produkty Femtech czerpią z bardzo różnych źródeł. Mogą one obejmować rzeczy, które użytkownik bezpośrednio obserwuje, takie jak daty miesiączki lub subiektywne raporty, takie jak ból lub nastrój, a także funkcje noszone, takie jak temperatura skóry i zmienność rytmu serca, oraz zmienne, które model wygenerował sam. Traktowanie ich jako wymiennych danych wejściowych jest pierwotnym grzechem.
Każdy sygnał wymaga pochodzenia, które system może odczytać: skąd pochodzi, kiedy, jak często jest pobierany, co go zakłóca i jak się odnosi do rzeczy, którą naprawdę przewidujesz. Owulacja jest zdarzeniem. Temperatura, śluz szyjkowy, LH i daty cyklu są dowodami na to zdarzenie, każde z własnym opóźnieniem i własnym błędem.
Brakujące dane zasługują na szczególną uwagę, ponieważ w śledzeniu zdrowia rzadko są losowe. Ludzie rejestrują się więcej, gdy są zaniepokojeni, i przestają, gdy czują się dobrze, więc luka może zawierać tyle samo informacji, co wpis. W rzeczywistej analizie ponad 600 000 cykli owulacyjnych owulację nie można było wykryć w 665 603 z 1,4 miliona cykli początkowo branych pod uwagę. Trzy czwarte z nich miało ważne odczyty temperatury w mniej niż połowie dni cyklu. Wystarczalność danych była głównym czynnikiem ograniczającym to, co algorytm mógł wnioskować. Produkt, który emituje czysty etykietę płodności w tej sytuacji, nie jest pewny. Wytwarza precyzyjność, której nie posiada.
2. Kalibruj inferencję do dowodów
Jeden wynik ufności nie może reprezentować tego, co naprawdę się dzieje, ponieważ systemy te stają w obliczu kilku odrębnych źródeł niepewności jednocześnie. Obejmują one biologiczną zmienność samego procesu, jakość pomiaru, brak danych z samoodpowiedzi, niepewność modelu z cienkich danych szkoleniowych i przesunięcie dystrybucji, gdy bieżący użytkownik nie przypomina populacji, na której model został zwalidowany.
W tej samej analizie tylko 13% cykli trwało dokładnie 28 dni, a średnia faza folikularna wynosiła 16,9 dni w zakresie wystarczająco szerokim, aby każde założenie “dnia 14” było mylące. Badanie zdrowia kobiet Apple stwierdziło, że długość cyklu i zmienność wewnątrz osoby były związane z wiekiem, samooceną etniczną i indeksem masy ciała. Personalizacja nie może oznaczać więc zamiany średniej populacyjnej na jeden punkt osobisty. Oznacza to wytworzenie dystrybucji, która zacieśnia się wraz z gromadzeniem się dowodów.
Rozważmy dwa przewidywania oparte na sztucznej inteligencji, które oba czytają “75%”. Jeden opiera się na roku historii i gęstych pomiarach, a jego niepewność jest głównie prawdziwą biologią. Drugi opiera się na dwóch cyklach, pięciu odczytach temperatury, niedawnym podróżowaniu i nieznanym leczeniu. Tutaj niepewność jest głównie spowodowana brakiem danych. Taki sam numer. Produkt nie powinien być w stanie odpowiedzieć na nie w ten sam sposób. To jest również powodem, dla którego kalibracja musi być sprawdzana w podgrupach – agregowana wydajność może ukryć model, który jest zbyt pewny, szczególnie dla nieregularnych cykli lub użytkowników w okresie okołomenopauzalnym. Literatura kliniczna dotycząca sztucznej inteligencji oddziela dyskryminację, kalibrację i użyteczność decyzji właśnie z tego powodu. Model może dobrze klasyfikować użytkowników i nadal wytwarzać błędne prawdopodobieństwa dla prawdziwych decyzji.
3. Mapuj konsekwencje błędu
Trzecia warstwa pyta, co się dzieje, gdy system jest błędny, i wiąże dozwoloną odpowiedź z tym kosztem. Podsumowanie cyklu, szacunek okna płodności, etykieta niskiej płodności odczytywana jako porada antykoncepcyjna i interpretacja objawu, która decyduje, czy ktoś szuka pomocy, nie są tym samym produktem, nawet gdy model za nimi jest identyczny.
Klasyfikuję dane wyjściowe w cztery poziomy według konsekwencji: informacyjne, behawioralne, reprodukcyjne i kliniczne. Każdy z nich ma własny próg dowodów, dozwoloną terminologię i ścieżkę eskalacji. Prawdopodobieństwo 70% może być wystarczające do zgadnienia, kiedy okres się zacznie, i nie jest nawet blisko wystarczające, aby zapewnić komuś, że nie zajdzie w ciążę.
To jest miejsce, w którym spotyka się projekt z regulacją. Czy oprogramowanie przechodzi w obszar urządzeń medycznych, zależy od jego przeznaczenia i roli, jaką jego dane wyjściowe odgrywają w decyzji zdrowotnej. Aktualne wytyczne FDA dotyczące oprogramowania wspierającego decyzje kliniczne, zaktualizowane w styczniu 2026 r., są explicite, że funkcje przeznaczone dla pacjentów i opiekunów mogą spełniać definicję urządzenia. Pozycjonowanie regulacyjne nie jest przeglądem prawnym na końcu. Jest zakodowane w Twoich progach, słownictwie i logice eskalacji od dnia pierwszego.
4. Przekształć niepewność w politykę kontroli
Powszechny “wyniki mogą być nieprecyzyjne” przekazuje cały problem interpretacji z powrotem do użytkownika. Polityka kontroli robi coś przeciwnego. Dla danego stanu dowodów decyduje, czy system wyświetla obserwację, oferuje ograniczony zakres, prosi o kolejne pomiary, wskazuje na klinicystę czy odmawia odpowiedzi. Wstrzemięźliwość jest możliwością produktu, a nie awarią. “Nie jesteśmy jeszcze pewni” powinno być zaprojektowanym stanem z następnym krokiem, a nie ekranem błędu.
Konkretnie, zamiast “Owulacja: Dzień 15, 78% ufności”, odpowiedź zarządzana brzmi bliżej tego: owulacja jest najprawdopodobniej w ciągu czterodniowego okna; ufność jest ograniczona przez brakujące dane temperatury i zaburzony sen; kilka więcej odczytów mogłoby udoskonalić szacunek, a test LH mógłby dodać perspektywiczne dowody i zawęzić prawdopodobne okno. Użytkownik otrzymuje szacunek, powód, dla którego jest on niepewny, i jedną akcję, która mogłaby to zmienić.
5. Wspieraj działanie, które wynika z danych wyjściowych
Nawet aplikacja konsumencka tworzy przepływ pracy: zaloguj kolejne odczyty, powtórz test, kontynuuj obserwację, wyeksportuj dane, skontaktuj się z klinicystą. System powinien wiedzieć, jaką akcję każda odpowiedź wskazuje, i czy może ją wspierać bezpiecznie.
Granica między poradami produktu a poradami medycznymi leży tutaj, i nie jest to ustalona linia. Treści edukacyjne wyjaśniające, co sygnał ogólnie oznacza, mieszczą się bezpiecznie po stronie porad. Produkt przechodzi w obszar wyższego ryzyka, gdy interpretuje dane jednej osoby jako chorobę, kieruje leczeniem lub oferuje zapewnienie, które ma realną wagę kliniczną. Ta granica musi być utrzymana przy każdej interakcji, a nie tylko w warunkach usługi.
6. Zamknij pętlę odpowiedzialności
Ostatnia warstwa ocenia cały system, a nie tylko model. Standardowe metryki modelu nadal mają znaczenie i koncentrują się na dyskryminacji, kalibracji, wydajności podgrup, walidacji zewnętrznej i czasowej. Ale metryki poziomu produktu mają równie wielkie znaczenie. Powinniśmy spytać, jak często system miał wystarczające dane wejściowe, aby działać, jak często wstrzymywał się. Plus jeden, na który naciskam, to wskaźnik fałszywego zapewnienia, czyli jak często powiedział komuś, że wszystko wygląda dobrze na podstawie dowodów, które nie mogłyby wesprzeć twierdzenia.
Każda konsekwencja odpowiedzi powinna być możliwa do odtworzenia po fakcie. Regulatorzy, organy standaryzacji i instytucje zarządzania zdrowiem na całym świecie coraz częściej przyjmują ten punkt widzenia cyklu życia. Zasady dobrej praktyki maszynowego uczenia się IMDRF traktują godne zaufania urządzenia medyczne AI jako pełną odpowiedzialność cyklu życia, obejmującą projekt, wdrożenie i monitorowanie, co powtarza wytyczne WHO dotyczące AI dla zdrowia.
Jak wygląda architektura w praktyce
Powiedzmy, że produkt ma trzy miesiące dat cyklu, sześć nocy temperatury, jeden pozytywny test LH, kilka wpisów objawów i tydzień złego snu. Najwyższe prawdopodobieństwo owulacji modelu pada na dzień 15. Aplikacja z szacunkiem punktowym wyświetla “Owulacja: Dzień 15, 78% ufności”.
Architektura wytwarza coś innego. Oznacza dane temperatury jako rzadkie i zakłócone snem. Generuje dystrybucję na kilka kandydujących dni zamiast jednego. Stosuje łagodny próg dla świadomości cyklu, ale surowszy, jeśli dane wyjściowe dotykają zapobiegania ciąży. Oferuje zakres plus następne przydatne pomiary. I przechowuje cały stan dowodów, aby decyzja mogła być później odtworzona. Ten sam podstawowy model i zupełnie inny produkt.
Prawo do działania
Systemy Femtech są coraz bardziej wzbogacone w dane, z aplikacjami, noszonymi urządzeniami, testami domowymi, rekordami medycznymi i warstwami konwersacyjnymi ułożonymi na górze. Więcej danych może udoskonalić inferencję, ale także rozszerza powierzchnię fałszywej precyzyjności. Zespoły, które zdobędą zaufanie, nie będą tymi z najczystszym wynikiem ufności. Będą tymi, których produkty wiedzą, czego nie wiedzą, i są zaprojektowane, aby to powiedzieć.
Dokładność opisuje jakość przewidywania. Integralność decyzji decyduje, czy produkt zdobył prawo do działania na jej podstawie.












