Sundhedsvæsen
Fra forudsigelse til ansvarlig handling: Design af usikkerhed i Femtech AI

I kvindehelbred er nøjagtighed nødvendig, men det er kun det første lag af produktsikkerhed. Det er vigtigt, at systemet ved, når en forudsigelse er stærk nok til at handle på, og er bygget til at sige det, når det ikke er.
Åbn de fleste fertilitets- eller cyklus-sporingsapps, og du vil se et rent resultat: ovulation på dag 15, en høj-fertilitetsmærkning, en tillidsvurdering på 78%. Tallene ser præcise ud. Biologien under dem er det ikke.
En menstruationsdato er noget, brugeren har observeret. Ovulation er en latent begivenhed, som ingen forbrugerenhed måler direkte. Det er afledt fra proxyer. Hudtemperatur reflekterer ikke kun progesteron, men også søvn, alkohol, sygdom, omgivelsesbetingelser og hvor sensoren sad den nat. En symptombeskrivelse blandes fysiologi med perception, hukommelse og brugerens beslutning om at logge det overhovedet. Inden alt dette opløses i “Dag 15, 78%”, er der flere forskellige former for usikkerhed, der er blevet stille komprimeret til en enkelt tillidsvurdering.
I de produkter, jeg har arbejdet på inden for kvindehelbred, er det hårde problem ikke nøjagtighed. Mønsteret, jeg hele tiden vender tilbage til, er beslutningsintegritet. Nøjagtighed fortæller dig, hvor godt en model forudser. Det siger ingenting om, hvorvidt produktet ved, når en forudsigelse er stærk nok til at handle på. I et domæne, hvor samme output kan informere om en afledt plan eller en præventiv beslutning, er det her, hvor tillid vindes eller tabes.
Så mit argument er, at Femtech AI ikke primært behøver bedre forudsigelse. Det behøver bedre usikkerhedsdesign. Og usikkerhedsdesign er ikke en disclaimer, der er boltet på før lancering; det er en arkitektur. Jeg strukturerer det i seks lag, der bærer en signal fra rå input til en handling, som systemet kan retfærdiggøre og auditere. Jeg anvender en seks-lags version af den kalibrerede beslutnings-til-handling-metode, designet til at styre, hvordan usikre sundheds-signaler konverteres til tilladte og ansvarlige handlinger. Metoden inkluderer datakvalifikation, inferenskalibrering, konsekvenskortlægning, styringspolitik, arbejdsgangsudførelse og en ansvarsløkke. Dens styrende vej starter med sundhedsdata, der fører til beslutningsarkitektur og kulminerer i ansvarlig handling.
1. Kvalificér data før du stoler på det
Det første lag beslutter, hvad systemet faktisk ved. Femtech-produkter trækker fra meget forskellige kilder. Det kan inkludere ting, brugeren direkte har observeret, såsom menstruationsdatoer eller subjektive rapporter som smerter eller humør, samt bærbare funktioner som hudtemperatur og hjertefrekvensvariation, og variable, som modellen selv har genereret. At behandle disse som udskiftelige input er den oprindelige synd.
Hver signal har brug for proveniens, som systemet kan læse: hvor det kommer fra, hvornår, hvor ofte det samples, hvad der forvirrer det, og hvordan det relaterer til det, du faktisk forudser. Ovulation er begivenheden. Temperatur, cervikal slim, LH og cyklusdatoer er bevis om den begivenhed, hver med sin egen forsinkelse og fejl.
Manglende data fortjener særlig opmærksomhed, fordi det i sundhedssporing sjældent er tilfældigt. Mennesker logger mere, når de er bekymrede, og stopper, når de føler sig fine, så et hul kan bære lige så meget information som en indtastning. I en reel verden analyse af over 600.000 ovulatoriske cykler, kunne ovulation ikke detekteres i 665.603 af de 1,4 millioner cykler, der først blev overvejet. Tre fjerdedele af disse havde gyldige temperaturmålinger på færre end halvdelen af dagene i cyklen. Data-sufficiens var en stor begrænsende faktor i, hvad algoritmen kunne slutte. Et produkt, der udsender en klar fertilitetsmærkning i den situation, er ikke selvbevidst. Det fabrikerer præcision, det ikke har.
2. Kalibrér inferensen til beviset
En enkelt tillidsvurdering kan ikke repræsentere, hvad der faktisk sker, fordi disse systemer står over for flere forskellige kilder til usikkerhed på én gang. Disse inkluderer biologisk variation i processen selv, måle kvalitet, manglende data fra selv-sporing, model-usikkerhed fra tynd træningsdata og distributionsforandringer, når den nuværende bruger ikke ligner populationen, som modellen blev valideret på.
I samme analyse var kun 13% af cyklerne præcis 28 dage lange, og den gennemsnitlige follikulære fase løb 16,9 dage over et område, der var bredt nok til at gøre enhver fast “dag 14”-antagelse misvisende. Den Apple Women’s Health Study fandt, at cykluslængde og indenfor-person-variation var forbundet med alder, selvrapporteret etnicitet og kropsmasseindeks. Personliggørelse kan således ikke betyde at erstatte en populationsgennemsnit med en enkelt personlig punkt. Det betyder at producere en distribution, der strammes, efterhånden som beviser akkumuleres.
Overvej to AI-baserede forudsigelser, der begge lyder “75%”. Den ene hviler på et år med historik og tæt målinger, og dens usikkerhed er mest rigtig biologi. Den anden hviler på to cykler, fem temperaturmålinger, nylig rejse og ukendt medicin. Her er usikkerheden mest på grund af manglende data. Samme nummer. Produktet skal ikke være tilladt at reagere på dem på samme måde. Dette er også hvorfor kalibrering skal kontrolleres inden for undergrupper – samlet præstation kan skjule en model, der er overbevidst, især for uregelmæssige cykler eller perimenopausale brugere. Den kliniske-AI-litteratur adskiller nu diskrimination, kalibrering og beslutningsnytten netop af denne grund. En model kan rangere brugere godt og stadig producere forkerte sandsynligheder for rigtige beslutninger.
3. Kortlæg konsekvensen af at være forkert
Det tredje lag spørger, hvad der sker, når systemet er forkert, og binder den tilladte respons til den omkostning. En cyklus-sammenfatning, en frugtbar-vindue-estimation, en lav-fertilitetsmærkning læst som præventiv vejledning og en symptombeskrivelse, der afgør, om nogen søger hjælp, er ikke det samme produkt, selvom modellen bag dem er identisk.
Jeg sorter output i fire niveauer efter konsekvens: informativ, adfærdsmæssig, reproduktiv og klinisk. Hver får sin egen bevis-threshold, tilladt sprog og eskalationssti. En 70%-sandsynlighed kan være fin til at gætte, hvornår en periode starter, og langt fra nok til at berolige nogen, der forsøger at undgå at blive gravid.
Dette er, hvor design møder regulering. Om software krydser ind i medicinsk enheds-territorium afhænger af dens intention og rollen, dens output spiller i en sundhedsbeslutning. Den FDA’s nuværende Clinical Decision Support Software-retningslinjer, opdateret i januar 2026, er eksplicit, at funktioner, der er tiltænkt patienter og omsorgspersoner, kan opfylde definitionen af en enhed. Regulativ positionering er ikke en juridisk gennemgang i slutningen. Det er indkodet i dine threshold, dit ordvalg og din eskalationslogik fra dag én.
4. Omdan usikkerhed til en styringspolitik
En blanket “resultater kan være ukorrekte” giver hele fortolkningsproblemet tilbage til brugeren. En styringspolitik gør det modsatte. For en given bevis-tilstand beslutter den, om systemet viser en observation, tilbyder en begrænset række, beder om en anden måling, peger på en kliniker eller nægter at svare. Afholdenhed er en produktfunktion, ikke en fejl. “Vi er ikke sikre endnu” skal være en designet tilstand med en næste skridt, ikke en fejl-skærm.
Konkret, i stedet for “Ovulation: Dag 15, 78%”, producerer arkitekturen noget andet. Det markerer temperaturdata som sparsomt og sov-forstyrret. Det genererer en distribution over flere kandidat-dage i stedet for en. Det anvender en mild threshold for cyklus-bevidsthed, men en strengere, hvis output berører prævention af graviditet. Det tilbyder en række samt den næste nyttige måling. Og det gemmer hele bevis-tilstanden, så beslutningen kan rekonstrueres senere. Samme underliggende model og et meget forskelligt produkt.
5. Støt handlingen, output antyder
Selv en forbruger-app skaber en arbejdsgang: log en anden måling, gentag en test, fortsæt med at observere, eksportér data, ring til en kliniker. Systemet skal vide, hvilken handling hver respons peger på, og om det kan støtte den handling sikkert.
Grænsen mellem produkt-vejledning og medicinsk rådgivning bor her, og det er ikke en fast linje. Uddannelsesmateriale, der forklarer, hvad en signal generelt betyder, sidder sikkert på vejledningssiden. Produktet bevæger sig ind i højere-risiko-territorium, øjeblikket det fortolker en persons data som sygdom, dirigerer behandling eller tilbyder beroligelse, der bærer rigtig klinisk vægt. Den grænse skal holde ved hver interaktion, ikke kun i vilkårene for tjenesten.
6. Luk ansvarsløkken
Det sidste lag bedømmer hele systemet, ikke kun modellen. Standard model-metrikker betyder stadig noget og fokuserer på diskrimination, kalibrering, undergruppe-præstation, ekstern og temporal validering. Men produkt-niveau-metrikker betyder lige så meget. Vi skal spørge, hvor ofte systemet havde nok input til at handle, hvor ofte det afholdt sig. Plus det, jeg ville insisterer på, er en falsk-beroligelses-rate, hvilket betyder, hvor hyppigt det fortalte nogen, at alt så fint ud på bevis, der ikke kunne understøtte påstanden.
Hver konsekvensfuld respons skal være rekonstruerbar efterfølgende. Regulatorer, standard-organisationer og globale sundheds-styringsinstitutioner adopterer mere og mere denne livscyklus-syn. Den IMDRF’s gode maskinlærings-principper behandler troværdig medicinsk AI som en total-livscyklus-ansvar, der spænder over design, implementering og overvågning, og gentager WHO’s vejledning om AI til sundhed.
Hvad arkitekturen ser ud i praksis
Sæt, at et produkt har tre måneder med menstruationsdatoer, seks nætter med temperatur, en positiv LH-test, en spredning af symptombeskrivelser og en uge med dårlig søvn. Modellens højeste ovulations-sandsynlighed lander på dag 15. Et punkt-estimations-app viser “Ovulation: Dag 15, Tillid 78%”.
Arkitekturen producerer noget andet. Det markerer temperaturdata som sparsomt og sov-forstyrret. Det genererer en distribution over flere kandidat-dage i stedet for en. Det anvender en mild threshold for cyklus-bevidsthed, men en strengere, hvis output berører prævention af graviditet. Det tilbyder en række samt den næste nyttige måling. Og det gemmer hele bevis-tilstanden, så beslutningen kan rekonstrueres senere. Samme underliggende model og et meget forskelligt produkt.
Retten til at handle
Femtech-systemer er kun blevet mere data-rige, med apps, bærbare enheder, hjemme-tester, medicinske journaler og samtale-lag på toppen. Mere data kan skærpe forudsigelse, men det åbner også op for en større overflade for falsk præcision. Holdene, der tjener tillid, vil ikke være dem med den reneste tillidsvurdering. De vil være dem, hvis produkter ved, hvad de ikke ved, og er bygget til at sige det, når de ikke er.
Nøjagtighed beskriver kvaliteten af en forudsigelse. Beslutningsintegritet afgør, om produktet har tjent retten til at handle på den.












