Zdravotnictví

Od předpovědi k odpovědnému jednání: Navrhování neurčitosti v Femtech AI

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

V oblasti zdraví žen je přesnost nezbytná, ale je to pouze první vrstva bezpečnosti produktu. Je důležité, aby systém věděl, kdy je předpověď dostatečně silná, aby se na ni dalo spolehnout, a aby byl navržen tak, aby řekl, kdy není.

Otevřete většinu aplikací pro sledování plodnosti nebo menstruačního cyklu a uvidíte čistý výsledek: ovulace dne 15, vysoká plodnost, důvěrný skóre 78%. Číslo vypadá přesně. Biologie pod ním není.

Datum menstruace je něco, co uživatel pozoroval. Ovulace je latentní událost, kterou žádný spotřebitelský přístroj přímo nezjišťuje. Je inferována z proxy. Teplota kůže odráží nejen progesteron, ale také spánek, alkohol, nemoc, okolní podmínky a polohu senzoru v noci. Zápis symptomů kombinuje fyziologii s vnímáním, pamětí a rozhodnutím uživatele o tom, zda ho zaznamenat. Do té doby, než se vše vyřeší v “Dni 15, 78%”, několik různých typů neurčitosti bylo potichu komprimováno do jedné sebevědomé věty.

V produktech, na kterých jsem pracoval v oblasti zdraví žen, není tvrdý problém přesnost. Vzorec, ke kterému se neustále vracím, je integrita rozhodnutí. Přesnost vám říká, jak dobře model předpovídá. Nic vám neříká o tom, zda produkt ví, kdy je předpověď dostatečně silná, aby se na ni dalo spolehnout. V oblasti, kde stejný výstup může informovat plánování nebo rozhodnutí o antikoncepci, je tato mezera místem, kde se získá nebo ztratí důvěra.

Můj argument je, že Femtech AI primárně nepotřebuje lepší předpověď. Potřebuje lepší návrh neurčitosti. A návrh neurčitosti není varováním, které se přidává před spuštěním; je to architektura. Strukturuji ji do šesti vrstev, které nesou signál z raw vstupu na akci, kterou systém může ospravedlnit a auditovat. Používám šestivrstvou verzi Metody kalibrovaného rozhodnutí k akci, která je navržena tak, aby řídila, jak jsou nejistá zdravotní signály převáděna na povolené a odpovědné akce. Metoda zahrnuje kvalifikaci dat, kalibraci inference, mapování důsledků, kontrolní politiku, provádění pracovního postupu a odpovědnostní smyčku. Její řídící cesta začíná zdravotními daty, která vedou k architektuře rozhodnutí a končí odpovědnou akcí.

1. Kvalifikujte data, než je budete důvěřovat

První vrstva rozhoduje, co systém skutečně ví. Produkty Femtech čerpají z velmi různých zdrojů. Může se jednat o věci, které uživatel přímo pozoroval, jako jsou data menstruace nebo subjektivní zprávy, jako je bolest nebo nálada, stejně jako funkce nositelných zařízení, jako je teplota kůže a variabilita srdeční frekvence, a proměnné, které model sám generoval. Léčba těchto jako vyměnných vstupů je původním hříchem.

Každý signál potřebuje původ, který systém může číst: odkud pochází, kdy, jak často je vzorkován, co ho ovlivňuje, a jak se vztahuje k tomu, co skutečně předpovídáte. Ovulace je událost. Teplota, cervikální hlen, LH a data cyklu jsou důkazy o této události, každý s vlastním zpožděním a chybou.

Chybějící data si zaslouží zvláštní pozornost, protože v sledování zdraví je to zřídka náhodné. Lidé více zaznamenávají, když se obávají, a přestávají, když se cítí dobře, takže mezera může nést stejně tolik informací jako vstup. V reálné analýze více než 600 000 ovulačních cyklů, nemohla být ovulace detekována u 665 603 z 1,4 milionu cyklů, které byly最初 považovány. Tři čtvrtiny z nich měly platné teplotní záznamy na méně než polovině dnů v cyklu. Dostačující data byla významným omezujícím faktorem toho, co mohl algoritmus odvodit. Produkt, který vydává čistou fertilitní značku v této situaci, není sebevědomý. Vyrábí přesnost, kterou nemá.

2. Kalibrujte inferenci na důkazy

Jeden důvěrný skóre nemůže reprezentovat, co se skutečně děje, protože tyto systémy čelí několika odlišným zdrojům neurčitosti najednou. Tyto zahrnují biologickou variabilitu v procesu, kvalitu měření, chybějící údaje ze sledování, neurčitost modelu z tenkých trénovacích dat a posun distribuce, když aktuální uživatel neodpovídá populaci, na které byl model ověřen.

V téže analýze byla pouze 13% cyklů přesně 28 dní dlouhá a průměrná folikulární fáze trvala 16,9 dní v dostatečně širokém rozsahu, aby každá pevná “den 14” předpoklad byla zavádějící. Studie Apple Women’s Health nalezla, že délka cyklu a variability uvnitř osoby byly spojeny s věkem, sebehlášenou etnicitou a indexem tělesné hmotnosti. Personalizace tedy nemůže znamenat pouze výměnu průměru populace za jeden osobní bod. Znamená to produkci distribuce, která se zužuje, jak se shromažďují důkazy.

Zvažte dvě AI-předpovědi, které obě čtení “75%”. Jedna spočívá na roce historie a hustých měřeních a její neurčitost je většinou skutečná biologie. Druhá spočívá na dvou cyklech, pěti teplotních záznamech, nedávném cestování a neznámém léku. Zde je neurčitostmostly způsobena chybějícími údaji. Stejné číslo. Produkt by neměl být povolen reagovat na ně stejným způsobem. To je také důvod, proč kalibrace musí být zkontrolována uvnitř subskupin – agregovaná výkonnost může skrýt model, který je nadměrně sebevědomý, zejména pro nepravidelné cykly nebo uživatele v perimenopauze. Klinická-AI literatura nyní odděluje diskriminaci, kalibraci a rozhodovací užitnost právě z tohoto důvodu. Model může dobře řadit uživatele a přesto produkovat nesprávné pravděpodobnosti pro skutečná rozhodnutí.

3. Mapujte důsledky toho, že jste špatní

Třetí vrstva se ptá, co se stane, když je systém špatný, a váže povolenou odpověď na tuto cenu. Souhrn cyklu, odhad plodného okna, nízká plodnost jako antikoncepční rady a interpretace symptomů, která rozhoduje, zda někdo vyhledá péči, nejsou stejné produkty, i když model za nimi je identický.

Rozdělím výstupy do čtyř úrovní podle důsledků: informačních, behaviorálních, reprodukčních a klinických. Každá z nich má svou vlastní prahovou hodnotu důkazů, povolený jazyk a eskalační cestu. 70% pravděpodobnost může být dostatečná pro odhad, kdy začne menstruace, a nikde blízko dostatečná, aby ujistila někoho, kdo se snaží nezotavit se.

To je místo, kde se setkává design s regulací. Zda software přechází do území zdravotnických zařízení závisí na jeho zamýšleném použití a roli, kterou jeho výstup hraje v zdravotním rozhodnutí. Aktuální pokyny FDA pro software Clinical Decision Support jsou explicitní, že funkce určené pro pacienty a pečovatele mohou splňovat definici zařízení. Regulační позиcionování není právní kontrolou na konci. Je zakódováno ve vašich prahových hodnotách, vašem znění a vaší eskalační logice od prvního dne.

4. Převěďte neurčitost na kontrolní politiku

Blanketní “výsledky mohou být nepřesné” předává celý interpretační problém zpět uživateli. Kontrolní politika dělá opak. Pro daný stav důkazů rozhoduje, zda systém zobrazí pozorování, nabídne omezený rozsah, požádá o další měření, ukáže na klinika nebo odmítne odpovědět. Zdržení se je schopností produktu, ne selháním. “Nejsme si jisti zatím” by mělo být navrženým stavem s dalším krokem, ne chybovým obrazem.

Konkrétně, místo “Ovulace: Den 15, 78%,” řízená odpověď zní blíže tomuto: ovulace je nejpravděpodobněji v rámci čtyřdenního okna; důvěra je omezena chybějícími teplotními údaji a narušeným spánkem; několik dalších měření by mohlo odhad zúžit, a test LH by mohl přidat prospektivní důkazy a zúžit pravděpodobné okno. Uživatel získá odhad, důvod, proč je neurčitý, a jedinou akci, která by ho změnila.

5. Podporujte akci, kterou výstup naznačuje

I spotřebitelská aplikace vytváří pracovní postup: zaznamenejte další čtení, zopakujte test, pokračujte v pozorování, exportujte data, zavolejte klinika. Systém by měl vědět, jakou akci každá odpověď naznačuje, a zda může tuto akci bezpečně podporovat.

Hranice mezi produktovou radou a lékařskou radou žije zde, a není to pevná linie. Vzdělávací obsah, který vysvětluje, co signál obecně znamená, sedí bezpečně na straně rady. Produkt se přesouvá do vyššího rizika, když interpretuje data jedné osoby jako onemocnění, směruje léčbu nebo nabízí ujištění, které nese skutečnou klinickou váhu. Tato hranice musí držet na každém interakci, ne pouze v podmínkách služby.

6. Zavřete odpovědnostní smyčku

Poslední vrstva soudí celý systém, ne pouze model. Standardní modelové metriky stále záleží a zaměřují se na diskriminaci, kalibraci, výkon subskupin, externí a časovou validaci. Ale produktové metriky záleží stejně. Měli bychom se ptát, jak často měl systém dostatečný vstup, aby jednal, jak často se zdržel. Plus jeden, na kterém bych trval, je míra falešného ujištění, což znamená, jak často řekl někomu, že vše vypadá v pořádku na důkazech, které toto tvrzení nepodporují.

Každá důsledková odpověď by měla být rekonstruovatelná po skutečnosti. Regulátoři, standardizační orgány a globální instituce zdravotního řízení jsou stále více přijímají tento životní pohled. Zásady dobré praxe strojového učení IMDRF považují důvěryhodný zdravotnický AI za celoživotní odpovědnost sahající od návrhu, přes nasazení, až po monitoring, což se odráží v Pokynech WHO pro AI ve zdravotnictví.

Jak vypadá architektura v praxi

Řekněme, že produkt má tři měsíce dat menstruace, šest nocí teploty, jeden pozitivní test LH, rozptýlené záznamy symptomů a týden špatného spánku. Nejvyšší pravděpodobnost ovulace modelu spadá na den 15. Aplikace s bodovým odhadem zobrazuje “Ovulace: Den 15, Důvěra 78%.”

Architektura produkuje něco jiného. Označuje teplotní data jako řídká a narušená spánkem. Generuje distribuci přes několik kandidátských dnů místo jednoho. Používá jemný práh pro povědomí o cyklu, ale přísnější pro prevenci početí. Nabízí rozsah plus další užitečné měření. A ukládá celý stav důkazů, aby se rozhodnutí mohlo později rekonstruovat. Stejný základní model a velmi odlišný produkt.

Právo jednat

Systémy Femtech jsou pouze stále datově bohatší, s aplikacemi, nositelnými zařízeními, domácími testy, zdravotnickými záznamy a konverzačními vrstvami naskládanými na vrchol. Více dat může inference zúžit, ale také rozšiřuje povrch pro falešnou přesnost. Týmy, které získají důvěru, nebudou ty, které mají nejčistší důvěrný skóre. Budou to ty, jejichž produkty vědí, co nevědí, a jsou navrženy tak, aby říkaly, kdy nejsou.

Přesnost popisuje kvalitu předpovědi. Integrita rozhodnutí rozhoduje, zda produkt získal právo jednat na jejím základě.

Mariia Kulikovskaia je odborník na produktovou strategii pro datové produkty související se zdravím, který pracuje napříč produkty souvisejícími se zdravím, environmentálním zdravím a technologiemi umožněnými umělou inteligencí. Jeho práce zahrnuje B2B produktovou strategii pro systémy monitorování environmentálního zdraví a produkty analytiky zdravotnictví.