SundhedsvÃĶsen

Fra forudsigelse til ansvarlig handling: Design af usikkerhed i Femtech AI

mm
FÃļj Unite.AI til dine foretrukne kilder pÃĨ Google

I kvindehelbred er nÃļjagtighed nÃļdvendig, men det er kun det fÃļrste lag af produktsikkerhed. Det er vigtigt, at systemet ved, nÃĨr en forudsigelse er stÃĶrk nok til at handle pÃĨ, og er bygget til at sige det, nÃĨr det ikke er.

Åbn de fleste fertilitets- eller cyklus-sporingsapps, og du vil se et rent resultat: ovulation pÃĨ dag 15, en hÃļj-fertilitetsmÃĶrkning, en tillidsvurdering pÃĨ 78%. Tallene ser prÃĶcise ud. Biologien under dem er det ikke.

En menstruationsdato er noget, brugeren har observeret. Ovulation er en latent begivenhed, som ingen forbrugerenhed mÃĨler direkte. Det er afledt fra proxyer. Hudtemperatur reflekterer ikke kun progesteron, men ogsÃĨ sÃļvn, alkohol, sygdom, omgivelsesbetingelser og hvor sensoren sad den nat. En symptombeskrivelse blandes fysiologi med perception, hukommelse og brugerens beslutning om at logge det overhovedet. Inden alt dette oplÃļses i “Dag 15, 78%”, er der flere forskellige former for usikkerhed, der er blevet stille komprimeret til en enkelt tillidsvurdering.

I de produkter, jeg har arbejdet pÃĨ inden for kvindehelbred, er det hÃĨrde problem ikke nÃļjagtighed. MÃļnsteret, jeg hele tiden vender tilbage til, er beslutningsintegritet. NÃļjagtighed fortÃĶller dig, hvor godt en model forudser. Det siger ingenting om, hvorvidt produktet ved, nÃĨr en forudsigelse er stÃĶrk nok til at handle pÃĨ. I et domÃĶne, hvor samme output kan informere om en afledt plan eller en prÃĶventiv beslutning, er det her, hvor tillid vindes eller tabes.

SÃĨ mit argument er, at Femtech AI ikke primÃĶrt behÃļver bedre forudsigelse. Det behÃļver bedre usikkerhedsdesign. Og usikkerhedsdesign er ikke en disclaimer, der er boltet pÃĨ fÃļr lancering; det er en arkitektur. Jeg strukturerer det i seks lag, der bÃĶrer en signal fra rÃĨ input til en handling, som systemet kan retfÃĶrdiggÃļre og auditere. Jeg anvender en seks-lags version af den kalibrerede beslutnings-til-handling-metode, designet til at styre, hvordan usikre sundheds-signaler konverteres til tilladte og ansvarlige handlinger. Metoden inkluderer datakvalifikation, inferenskalibrering, konsekvenskortlÃĶgning, styringspolitik, arbejdsgangsudfÃļrelse og en ansvarslÃļkke. Dens styrende vej starter med sundhedsdata, der fÃļrer til beslutningsarkitektur og kulminerer i ansvarlig handling.

1. KvalificÃĐr data fÃļr du stoler pÃĨ det

Det fÃļrste lag beslutter, hvad systemet faktisk ved. Femtech-produkter trÃĶkker fra meget forskellige kilder. Det kan inkludere ting, brugeren direkte har observeret, sÃĨsom menstruationsdatoer eller subjektive rapporter som smerter eller humÃļr, samt bÃĶrbare funktioner som hudtemperatur og hjertefrekvensvariation, og variable, som modellen selv har genereret. At behandle disse som udskiftelige input er den oprindelige synd.

Hver signal har brug for proveniens, som systemet kan lÃĶse: hvor det kommer fra, hvornÃĨr, hvor ofte det samples, hvad der forvirrer det, og hvordan det relaterer til det, du faktisk forudser. Ovulation er begivenheden. Temperatur, cervikal slim, LH og cyklusdatoer er bevis om den begivenhed, hver med sin egen forsinkelse og fejl.

Manglende data fortjener sÃĶrlig opmÃĶrksomhed, fordi det i sundhedssporing sjÃĶldent er tilfÃĶldigt. Mennesker logger mere, nÃĨr de er bekymrede, og stopper, nÃĨr de fÃļler sig fine, sÃĨ et hul kan bÃĶre lige sÃĨ meget information som en indtastning. I en reel verden analyse af over 600.000 ovulatoriske cykler, kunne ovulation ikke detekteres i 665.603 af de 1,4 millioner cykler, der fÃļrst blev overvejet. Tre fjerdedele af disse havde gyldige temperaturmÃĨlinger pÃĨ fÃĶrre end halvdelen af dagene i cyklen. Data-sufficiens var en stor begrÃĶnsende faktor i, hvad algoritmen kunne slutte. Et produkt, der udsender en klar fertilitetsmÃĶrkning i den situation, er ikke selvbevidst. Det fabrikerer prÃĶcision, det ikke har.

2. KalibrÃĐr inferensen til beviset

En enkelt tillidsvurdering kan ikke reprÃĶsentere, hvad der faktisk sker, fordi disse systemer stÃĨr over for flere forskellige kilder til usikkerhed pÃĨ ÃĐn gang. Disse inkluderer biologisk variation i processen selv, mÃĨle kvalitet, manglende data fra selv-sporing, model-usikkerhed fra tynd trÃĶningsdata og distributionsforandringer, nÃĨr den nuvÃĶrende bruger ikke ligner populationen, som modellen blev valideret pÃĨ.

I samme analyse var kun 13% af cyklerne prÃĶcis 28 dage lange, og den gennemsnitlige follikulÃĶre fase lÃļb 16,9 dage over et omrÃĨde, der var bredt nok til at gÃļre enhver fast “dag 14”-antagelse misvisende. Den Apple Women’s Health Study fandt, at cykluslÃĶngde og indenfor-person-variation var forbundet med alder, selvrapporteret etnicitet og kropsmasseindeks. PersonliggÃļrelse kan sÃĨledes ikke betyde at erstatte en populationsgennemsnit med en enkelt personlig punkt. Det betyder at producere en distribution, der strammes, efterhÃĨnden som beviser akkumuleres.

Overvej to AI-baserede forudsigelser, der begge lyder “75%”. Den ene hviler pÃĨ et ÃĨr med historik og tÃĶt mÃĨlinger, og dens usikkerhed er mest rigtig biologi. Den anden hviler pÃĨ to cykler, fem temperaturmÃĨlinger, nylig rejse og ukendt medicin. Her er usikkerheden mest pÃĨ grund af manglende data. Samme nummer. Produktet skal ikke vÃĶre tilladt at reagere pÃĨ dem pÃĨ samme mÃĨde. Dette er ogsÃĨ hvorfor kalibrering skal kontrolleres inden for undergrupper – samlet prÃĶstation kan skjule en model, der er overbevidst, isÃĶr for uregelmÃĶssige cykler eller perimenopausale brugere. Den kliniske-AI-litteratur adskiller nu diskrimination, kalibrering og beslutningsnytten netop af denne grund. En model kan rangere brugere godt og stadig producere forkerte sandsynligheder for rigtige beslutninger.

3. KortlÃĶg konsekvensen af at vÃĶre forkert

Det tredje lag spÃļrger, hvad der sker, nÃĨr systemet er forkert, og binder den tilladte respons til den omkostning. En cyklus-sammenfatning, en frugtbar-vindue-estimation, en lav-fertilitetsmÃĶrkning lÃĶst som prÃĶventiv vejledning og en symptombeskrivelse, der afgÃļr, om nogen sÃļger hjÃĶlp, er ikke det samme produkt, selvom modellen bag dem er identisk.

Jeg sorter output i fire niveauer efter konsekvens: informativ, adfÃĶrdsmÃĶssig, reproduktiv og klinisk. Hver fÃĨr sin egen bevis-threshold, tilladt sprog og eskalationssti. En 70%-sandsynlighed kan vÃĶre fin til at gÃĶtte, hvornÃĨr en periode starter, og langt fra nok til at berolige nogen, der forsÃļger at undgÃĨ at blive gravid.

Dette er, hvor design mÃļder regulering. Om software krydser ind i medicinsk enheds-territorium afhÃĶnger af dens intention og rollen, dens output spiller i en sundhedsbeslutning. Den FDA’s nuvÃĶrende Clinical Decision Support Software-retningslinjer, opdateret i januar 2026, er eksplicit, at funktioner, der er tiltÃĶnkt patienter og omsorgspersoner, kan opfylde definitionen af en enhed. Regulativ positionering er ikke en juridisk gennemgang i slutningen. Det er indkodet i dine threshold, dit ordvalg og din eskalationslogik fra dag ÃĐn.

4. Omdan usikkerhed til en styringspolitik

En blanket “resultater kan vÃĶre ukorrekte” giver hele fortolkningsproblemet tilbage til brugeren. En styringspolitik gÃļr det modsatte. For en given bevis-tilstand beslutter den, om systemet viser en observation, tilbyder en begrÃĶnset rÃĶkke, beder om en anden mÃĨling, peger pÃĨ en kliniker eller nÃĶgter at svare. Afholdenhed er en produktfunktion, ikke en fejl. “Vi er ikke sikre endnu” skal vÃĶre en designet tilstand med en nÃĶste skridt, ikke en fejl-skÃĶrm.

Konkret, i stedet for “Ovulation: Dag 15, 78%”, producerer arkitekturen noget andet. Det markerer temperaturdata som sparsomt og sov-forstyrret. Det genererer en distribution over flere kandidat-dage i stedet for en. Det anvender en mild threshold for cyklus-bevidsthed, men en strengere, hvis output berÃļrer prÃĶvention af graviditet. Det tilbyder en rÃĶkke samt den nÃĶste nyttige mÃĨling. Og det gemmer hele bevis-tilstanden, sÃĨ beslutningen kan rekonstrueres senere. Samme underliggende model og et meget forskelligt produkt.

5. StÃļt handlingen, output antyder

Selv en forbruger-app skaber en arbejdsgang: log en anden mÃĨling, gentag en test, fortsÃĶt med at observere, eksportÃĐr data, ring til en kliniker. Systemet skal vide, hvilken handling hver respons peger pÃĨ, og om det kan stÃļtte den handling sikkert.

GrÃĶnsen mellem produkt-vejledning og medicinsk rÃĨdgivning bor her, og det er ikke en fast linje. Uddannelsesmateriale, der forklarer, hvad en signal generelt betyder, sidder sikkert pÃĨ vejledningssiden. Produktet bevÃĶger sig ind i hÃļjere-risiko-territorium, Ãļjeblikket det fortolker en persons data som sygdom, dirigerer behandling eller tilbyder beroligelse, der bÃĶrer rigtig klinisk vÃĶgt. Den grÃĶnse skal holde ved hver interaktion, ikke kun i vilkÃĨrene for tjenesten.

6. Luk ansvarslÃļkken

Det sidste lag bedÃļmmer hele systemet, ikke kun modellen. Standard model-metrikker betyder stadig noget og fokuserer pÃĨ diskrimination, kalibrering, undergruppe-prÃĶstation, ekstern og temporal validering. Men produkt-niveau-metrikker betyder lige sÃĨ meget. Vi skal spÃļrge, hvor ofte systemet havde nok input til at handle, hvor ofte det afholdt sig. Plus det, jeg ville insisterer pÃĨ, er en falsk-beroligelses-rate, hvilket betyder, hvor hyppigt det fortalte nogen, at alt sÃĨ fint ud pÃĨ bevis, der ikke kunne understÃļtte pÃĨstanden.

Hver konsekvensfuld respons skal vÃĶre rekonstruerbar efterfÃļlgende. Regulatorer, standard-organisationer og globale sundheds-styringsinstitutioner adopterer mere og mere denne livscyklus-syn. Den IMDRF’s gode maskinlÃĶrings-principper behandler trovÃĶrdig medicinsk AI som en total-livscyklus-ansvar, der spÃĶnder over design, implementering og overvÃĨgning, og gentager WHO’s vejledning om AI til sundhed.

Hvad arkitekturen ser ud i praksis

SÃĶt, at et produkt har tre mÃĨneder med menstruationsdatoer, seks nÃĶtter med temperatur, en positiv LH-test, en spredning af symptombeskrivelser og en uge med dÃĨrlig sÃļvn. Modellens hÃļjeste ovulations-sandsynlighed lander pÃĨ dag 15. Et punkt-estimations-app viser “Ovulation: Dag 15, Tillid 78%”.

Arkitekturen producerer noget andet. Det markerer temperaturdata som sparsomt og sov-forstyrret. Det genererer en distribution over flere kandidat-dage i stedet for en. Det anvender en mild threshold for cyklus-bevidsthed, men en strengere, hvis output berÃļrer prÃĶvention af graviditet. Det tilbyder en rÃĶkke samt den nÃĶste nyttige mÃĨling. Og det gemmer hele bevis-tilstanden, sÃĨ beslutningen kan rekonstrueres senere. Samme underliggende model og et meget forskelligt produkt.

Retten til at handle

Femtech-systemer er kun blevet mere data-rige, med apps, bÃĶrbare enheder, hjemme-tester, medicinske journaler og samtale-lag pÃĨ toppen. Mere data kan skÃĶrpe forudsigelse, men det ÃĨbner ogsÃĨ op for en stÃļrre overflade for falsk prÃĶcision. Holdene, der tjener tillid, vil ikke vÃĶre dem med den reneste tillidsvurdering. De vil vÃĶre dem, hvis produkter ved, hvad de ikke ved, og er bygget til at sige det, nÃĨr de ikke er.

NÃļjagtighed beskriver kvaliteten af en forudsigelse. Beslutningsintegritet afgÃļr, om produktet har tjent retten til at handle pÃĨ den.

Mariia Kulikovskaia er en professionel indenfor Produktstrategi for sundhedsrelaterede dataprodukter, der arbejder pÃĨ tvÃĶrs af sundhedsrelaterede, miljÃļsundheds- og AI-aktiverede teknologiprodukter. Hendes arbejde omfatter B2B-produktstrategi for miljÃļsundheds-overvÃĨgningsystemer og sundheds-kompatible analytics-produkter.