Ochrona zdrowia
Od przewidywania do odpowiedzialnych dziaÅaÅ: projektowanie niepewnoÅci w Femtech AI

W zdrowiu kobiet, dokÅadnoÅÄ jest konieczna, ale jest to tylko pierwsza warstwa bezpieczeÅstwa produktu. WaÅžne jest, aby system wiedziaÅ, kiedy przewidywanie jest wystarczajÄ co silne, aby na niego dziaÅaÄ, i jest zaprojektowany, aby powiedzieÄ, kiedy nie jest.
OtwÃģrz wiÄkszoÅÄ aplikacji do Åledzenia pÅodnoÅci lub cyklu, a zobaczysz czysty wynik: owulacja w dniu 15, wysoki poziom pÅodnoÅci, wynik ufnoÅci 78%. Liczba wyglÄ da na precyzyjnÄ . Biologia pod niÄ nie jest.
Data miesiÄ czki jest czymÅ, co uÅžytkownik obserwuje. Owulacja jest zjawiskiem ukrytym, ktÃģre Åžadne urzÄ dzenie konsumenckie nie mierzy bezpoÅrednio. Jest wnioskowana z poÅrednich wskaÅšnikÃģw. Temperatura skÃģry odzwierciedla nie tylko poziom progesteronu, ale takÅže sen, alkohol, chorobÄ, warunki otoczenia i miejsce, w ktÃģrym czujnik byÅ umieszczony tej nocy. Wprowadzony objaw ÅÄ czy fizjologiÄ z percepcjÄ , pamiÄciÄ i decyzjÄ uÅžytkownika o zalogowaniu go. Do momentu, gdy wszystko to rozwiÄ zuje siÄ w âDzieÅ 15, 78%â, kilka rÃģÅžnych rodzajÃģw niepewnoÅci zostaÅo cicho skompresowanych w jednÄ pewnÄ wypowiedÅš.
W produktach, nad ktÃģrymi pracowaÅem w dziedzinie zdrowia kobiet, trudnym problemem nie jest dokÅadnoÅÄ. Wzorcem, do ktÃģrego ciÄ gle wracam, jest integralnoÅÄ decyzji. DokÅadnoÅÄ mÃģwi, jak dobrze model przewiduje. Nie mÃģwi nic o tym, czy produkt wie, kiedy przewidywanie jest wystarczajÄ co silne, aby na niego dziaÅaÄ. W dziedzinie, w ktÃģrej ten sam wynik moÅže informowaÄ planowanie lub decyzjÄ antykoncepcyjnÄ , ta luka jest miejscem, w ktÃģrym zaufanie jest zdobywane lub tracone.
Moim argumentem jest wiÄc to, Åže Femtech AI nie potrzebuje przede wszystkim lepszych przewidywaÅ. Potrzebuje lepszego projektu niepewnoÅci. A projekt niepewnoÅci nie jest zastrzeÅženiem doÅÄ czonym przed uruchomieniem; jest to architektura. StrukturyzujÄ jÄ w szeÅciu warstwach, ktÃģre przenoszÄ sygnaÅ od surowych danych wejÅciowych do dziaÅania, ktÃģre system moÅže uzasadniÄ i audytowaÄ. StosujÄ szeÅciowarstwowÄ wersjÄ Metody Produktu Decyzji do DziaÅania, zaprojektowanÄ w celu zarzÄ dzania tym, jak niepewne sygnaÅy zdrowotne sÄ konwertowane w dozwolone i odpowiedzialne dziaÅania. Metoda obejmuje kwalifikacjÄ danych, kalibracjÄ inferencji, mapowanie konsekwencji, politykÄ kontroli, wykonanie przepÅywu pracy i pÄtlÄ odpowiedzialnoÅci. Jej ÅcieÅžka rzÄ dzÄ ca zaczyna siÄ od danych zdrowotnych, ktÃģre prowadzÄ do architektury decyzji i kulminujÄ w odpowiedzialnym dziaÅaniu.
1. Kwalifikuj dane przed zaufaniem im
Pierwsza warstwa decyduje, co system naprawdÄ wie. Produkty Femtech czerpiÄ z bardzo rÃģÅžnych ÅšrÃģdeÅ. MogÄ one obejmowaÄ rzeczy, ktÃģre uÅžytkownik bezpoÅrednio obserwuje, takie jak daty miesiÄ czki lub subiektywne raporty, takie jak bÃģl lub nastrÃģj, a takÅže funkcje noszone, takie jak temperatura skÃģry i zmiennoÅÄ rytmu serca, oraz zmienne, ktÃģre model wygenerowaÅ sam. Traktowanie ich jako wymiennych danych wejÅciowych jest pierwotnym grzechem.
KaÅždy sygnaÅ wymaga pochodzenia, ktÃģre system moÅže odczytaÄ: skÄ d pochodzi, kiedy, jak czÄsto jest pobierany, co go zakÅÃģca i jak siÄ odnosi do rzeczy, ktÃģrÄ naprawdÄ przewidujesz. Owulacja jest zdarzeniem. Temperatura, Åluz szyjkowy, LH i daty cyklu sÄ dowodami na to zdarzenie, kaÅžde z wÅasnym opÃģÅšnieniem i wÅasnym bÅÄdem.
BrakujÄ ce dane zasÅugujÄ na szczegÃģlnÄ uwagÄ, poniewaÅž w Åledzeniu zdrowia rzadko sÄ losowe. Ludzie rejestrujÄ siÄ wiÄcej, gdy sÄ zaniepokojeni, i przestajÄ , gdy czujÄ siÄ dobrze, wiÄc luka moÅže zawieraÄ tyle samo informacji, co wpis. W rzeczywistej analizie ponad 600 000 cykli owulacyjnych owulacjÄ nie moÅžna byÅo wykryÄ w 665 603 z 1,4 miliona cykli poczÄ tkowo branych pod uwagÄ. Trzy czwarte z nich miaÅo waÅžne odczyty temperatury w mniej niÅž poÅowie dni cyklu. WystarczalnoÅÄ danych byÅa gÅÃģwnym czynnikiem ograniczajÄ cym to, co algorytm mÃģgÅ wnioskowaÄ. Produkt, ktÃģry emituje czysty etykietÄ pÅodnoÅci w tej sytuacji, nie jest pewny. Wytwarza precyzyjnoÅÄ, ktÃģrej nie posiada.
2. Kalibruj inferencjÄ do dowodÃģw
Jeden wynik ufnoÅci nie moÅže reprezentowaÄ tego, co naprawdÄ siÄ dzieje, poniewaÅž systemy te stajÄ w obliczu kilku odrÄbnych ÅšrÃģdeÅ niepewnoÅci jednoczeÅnie. ObejmujÄ one biologicznÄ zmiennoÅÄ samego procesu, jakoÅÄ pomiaru, brak danych z samoodpowiedzi, niepewnoÅÄ modelu z cienkich danych szkoleniowych i przesuniÄcie dystrybucji, gdy bieÅžÄ cy uÅžytkownik nie przypomina populacji, na ktÃģrej model zostaÅ zwalidowany.
W tej samej analizie tylko 13% cykli trwaÅo dokÅadnie 28 dni, a Årednia faza folikularna wynosiÅa 16,9 dni w zakresie wystarczajÄ co szerokim, aby kaÅžde zaÅoÅženie âdnia 14â byÅo mylÄ ce. Badanie zdrowia kobiet Apple stwierdziÅo, Åže dÅugoÅÄ cyklu i zmiennoÅÄ wewnÄ trz osoby byÅy zwiÄ zane z wiekiem, samoocenÄ etnicznÄ i indeksem masy ciaÅa. Personalizacja nie moÅže oznaczaÄ wiÄc zamiany Åredniej populacyjnej na jeden punkt osobisty. Oznacza to wytworzenie dystrybucji, ktÃģra zacieÅnia siÄ wraz z gromadzeniem siÄ dowodÃģw.
RozwaÅžmy dwa przewidywania oparte na sztucznej inteligencji, ktÃģre oba czytajÄ â75%â. Jeden opiera siÄ na roku historii i gÄstych pomiarach, a jego niepewnoÅÄ jest gÅÃģwnie prawdziwÄ biologiÄ . Drugi opiera siÄ na dwÃģch cyklach, piÄciu odczytach temperatury, niedawnym podrÃģÅžowaniu i nieznanym leczeniu. Tutaj niepewnoÅÄ jest gÅÃģwnie spowodowana brakiem danych. Taki sam numer. Produkt nie powinien byÄ w stanie odpowiedzieÄ na nie w ten sam sposÃģb. To jest rÃģwnieÅž powodem, dla ktÃģrego kalibracja musi byÄ sprawdzana w podgrupach â agregowana wydajnoÅÄ moÅže ukryÄ model, ktÃģry jest zbyt pewny, szczegÃģlnie dla nieregularnych cykli lub uÅžytkownikÃģw w okresie okoÅomenopauzalnym. Literatura kliniczna dotyczÄ ca sztucznej inteligencji oddziela dyskryminacjÄ, kalibracjÄ i uÅžytecznoÅÄ decyzji wÅaÅnie z tego powodu. Model moÅže dobrze klasyfikowaÄ uÅžytkownikÃģw i nadal wytwarzaÄ bÅÄdne prawdopodobieÅstwa dla prawdziwych decyzji.
3. Mapuj konsekwencje bÅÄdu
Trzecia warstwa pyta, co siÄ dzieje, gdy system jest bÅÄdny, i wiÄ Åže dozwolonÄ odpowiedÅš z tym kosztem. Podsumowanie cyklu, szacunek okna pÅodnoÅci, etykieta niskiej pÅodnoÅci odczytywana jako porada antykoncepcyjna i interpretacja objawu, ktÃģra decyduje, czy ktoÅ szuka pomocy, nie sÄ tym samym produktem, nawet gdy model za nimi jest identyczny.
KlasyfikujÄ dane wyjÅciowe w cztery poziomy wedÅug konsekwencji: informacyjne, behawioralne, reprodukcyjne i kliniczne. KaÅždy z nich ma wÅasny prÃģg dowodÃģw, dozwolonÄ terminologiÄ i ÅcieÅžkÄ eskalacji. PrawdopodobieÅstwo 70% moÅže byÄ wystarczajÄ ce do zgadnienia, kiedy okres siÄ zacznie, i nie jest nawet blisko wystarczajÄ ce, aby zapewniÄ komuÅ, Åže nie zajdzie w ciÄ ÅžÄ.
To jest miejsce, w ktÃģrym spotyka siÄ projekt z regulacjÄ . Czy oprogramowanie przechodzi w obszar urzÄ dzeÅ medycznych, zaleÅžy od jego przeznaczenia i roli, jakÄ jego dane wyjÅciowe odgrywajÄ w decyzji zdrowotnej. Aktualne wytyczne FDA dotyczÄ ce oprogramowania wspierajÄ cego decyzje kliniczne, zaktualizowane w styczniu 2026 r., sÄ explicite, Åže funkcje przeznaczone dla pacjentÃģw i opiekunÃģw mogÄ speÅniaÄ definicjÄ urzÄ dzenia. Pozycjonowanie regulacyjne nie jest przeglÄ dem prawnym na koÅcu. Jest zakodowane w Twoich progach, sÅownictwie i logice eskalacji od dnia pierwszego.
4. PrzeksztaÅÄ niepewnoÅÄ w politykÄ kontroli
Powszechny âwyniki mogÄ byÄ nieprecyzyjneâ przekazuje caÅy problem interpretacji z powrotem do uÅžytkownika. Polityka kontroli robi coÅ przeciwnego. Dla danego stanu dowodÃģw decyduje, czy system wyÅwietla obserwacjÄ, oferuje ograniczony zakres, prosi o kolejne pomiary, wskazuje na klinicystÄ czy odmawia odpowiedzi. WstrzemiÄÅšliwoÅÄ jest moÅžliwoÅciÄ produktu, a nie awariÄ . âNie jesteÅmy jeszcze pewniâ powinno byÄ zaprojektowanym stanem z nastÄpnym krokiem, a nie ekranem bÅÄdu.
Konkretnie, zamiast âOwulacja: DzieÅ 15, 78% ufnoÅciâ, odpowiedÅš zarzÄ dzana brzmi bliÅžej tego: owulacja jest najprawdopodobniej w ciÄ gu czterodniowego okna; ufnoÅÄ jest ograniczona przez brakujÄ ce dane temperatury i zaburzony sen; kilka wiÄcej odczytÃģw mogÅoby udoskonaliÄ szacunek, a test LH mÃģgÅby dodaÄ perspektywiczne dowody i zawÄziÄ prawdopodobne okno. UÅžytkownik otrzymuje szacunek, powÃģd, dla ktÃģrego jest on niepewny, i jednÄ akcjÄ, ktÃģra mogÅaby to zmieniÄ.
5. Wspieraj dziaÅanie, ktÃģre wynika z danych wyjÅciowych
Nawet aplikacja konsumencka tworzy przepÅyw pracy: zaloguj kolejne odczyty, powtÃģrz test, kontynuuj obserwacjÄ, wyeksportuj dane, skontaktuj siÄ z klinicystÄ . System powinien wiedzieÄ, jakÄ akcjÄ kaÅžda odpowiedÅš wskazuje, i czy moÅže jÄ wspieraÄ bezpiecznie.
Granica miÄdzy poradami produktu a poradami medycznymi leÅžy tutaj, i nie jest to ustalona linia. TreÅci edukacyjne wyjaÅniajÄ ce, co sygnaÅ ogÃģlnie oznacza, mieszczÄ siÄ bezpiecznie po stronie porad. Produkt przechodzi w obszar wyÅžszego ryzyka, gdy interpretuje dane jednej osoby jako chorobÄ, kieruje leczeniem lub oferuje zapewnienie, ktÃģre ma realnÄ wagÄ klinicznÄ . Ta granica musi byÄ utrzymana przy kaÅždej interakcji, a nie tylko w warunkach usÅugi.
6. Zamknij pÄtlÄ odpowiedzialnoÅci
Ostatnia warstwa ocenia caÅy system, a nie tylko model. Standardowe metryki modelu nadal majÄ znaczenie i koncentrujÄ siÄ na dyskryminacji, kalibracji, wydajnoÅci podgrup, walidacji zewnÄtrznej i czasowej. Ale metryki poziomu produktu majÄ rÃģwnie wielkie znaczenie. PowinniÅmy spytaÄ, jak czÄsto system miaÅ wystarczajÄ ce dane wejÅciowe, aby dziaÅaÄ, jak czÄsto wstrzymywaÅ siÄ. Plus jeden, na ktÃģry naciskam, to wskaÅšnik faÅszywego zapewnienia, czyli jak czÄsto powiedziaÅ komuÅ, Åže wszystko wyglÄ da dobrze na podstawie dowodÃģw, ktÃģre nie mogÅyby wesprzeÄ twierdzenia.
KaÅžda konsekwencja odpowiedzi powinna byÄ moÅžliwa do odtworzenia po fakcie. Regulatorzy, organy standaryzacji i instytucje zarzÄ dzania zdrowiem na caÅym Åwiecie coraz czÄÅciej przyjmujÄ ten punkt widzenia cyklu Åžycia. Zasady dobrej praktyki maszynowego uczenia siÄ IMDRF traktujÄ godne zaufania urzÄ dzenia medyczne AI jako peÅnÄ odpowiedzialnoÅÄ cyklu Åžycia, obejmujÄ cÄ projekt, wdroÅženie i monitorowanie, co powtarza wytyczne WHO dotyczÄ ce AI dla zdrowia.
Jak wyglÄ da architektura w praktyce
Powiedzmy, Åže produkt ma trzy miesiÄ ce dat cyklu, szeÅÄ nocy temperatury, jeden pozytywny test LH, kilka wpisÃģw objawÃģw i tydzieÅ zÅego snu. NajwyÅžsze prawdopodobieÅstwo owulacji modelu pada na dzieÅ 15. Aplikacja z szacunkiem punktowym wyÅwietla âOwulacja: DzieÅ 15, 78% ufnoÅciâ.
Architektura wytwarza coÅ innego. Oznacza dane temperatury jako rzadkie i zakÅÃģcone snem. Generuje dystrybucjÄ na kilka kandydujÄ cych dni zamiast jednego. Stosuje Åagodny prÃģg dla ÅwiadomoÅci cyklu, ale surowszy, jeÅli dane wyjÅciowe dotykajÄ zapobiegania ciÄ Åžy. Oferuje zakres plus nastÄpne przydatne pomiary. I przechowuje caÅy stan dowodÃģw, aby decyzja mogÅa byÄ pÃģÅšniej odtworzona. Ten sam podstawowy model i zupeÅnie inny produkt.
Prawo do dziaÅania
Systemy Femtech sÄ coraz bardziej wzbogacone w dane, z aplikacjami, noszonymi urzÄ dzeniami, testami domowymi, rekordami medycznymi i warstwami konwersacyjnymi uÅoÅžonymi na gÃģrze. WiÄcej danych moÅže udoskonaliÄ inferencjÄ, ale takÅže rozszerza powierzchniÄ faÅszywej precyzyjnoÅci. ZespoÅy, ktÃģre zdobÄdÄ zaufanie, nie bÄdÄ tymi z najczystszym wynikiem ufnoÅci. BÄdÄ tymi, ktÃģrych produkty wiedzÄ , czego nie wiedzÄ , i sÄ zaprojektowane, aby to powiedzieÄ.
DokÅadnoÅÄ opisuje jakoÅÄ przewidywania. IntegralnoÅÄ decyzji decyduje, czy produkt zdobyÅ prawo do dziaÅania na jej podstawie.












