Modely a platformy AI

Revoluce ve zdravotnictví: Prozkoumání dopadu a budoucnosti velkých jazykových modelů v medicíně

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Integrace a aplikace velkých jazykových modelů (LLM) v medicíně a zdravotnictví je téma značného zájmu a rozvoje.

Jak bylo poznamenáno na konferenci Healthcare Information Management and Systems Society a na dalších významných akcích, společnosti jako Google (GOOGL ) jsou v čele při zkoumání potenciálu generativního AI ve zdravotnictví. Jejich iniciativy, jako je Med-PaLM 2, ukazují se vyvíjející krajinu AI poháněných zdravotnických řešení, zejména v oblastech jako diagnostika, péče o pacienty a administrativní efektivita.

Googleův Med-PaLM 2, průkopnický LLM v oblasti zdravotnictví, prokázal působivé schopnosti, zejména dosáhl „expertní“ úrovně v otázkách podobných U.S. Medical Licensing Examination. Tento model a další podobné slibují revolucionalizovat způsob, jakým zdravotničtí pracovníci přistupují a využívají informace, potenciálně zlepšují diagnostickou přesnost a efektivitu péče o pacienty.

Však vedle těchto pokroků byly vzneseny obavy o praktičnost a bezpečnost těchto technologií ve zdravotnických prostředích. Například závislost na rozsáhlých internetových zdrojích dat pro školení modelů, zatímco prospěšná v některých kontextech, nemusí být vždy vhodná nebo spolehlivá pro lékařské účely. Jak Nigam Shah, PhD, MBBS, hlavní datový vědec pro Stanford Health Care, poukazuje, klíčové otázky se týkají výkonu těchto modelů ve skutečných zdravotnických prostředích a jejich skutečného dopadu na péči o pacienty a efektivitu zdravotnictví.

Perspektiva Dr. Shaha zdůrazňuje potřebu více uzpůsobeného přístupu k využívání LLM ve medicíně. Místo obecných modelů školených na širokých internetových datech navrhuje více zaměřenou strategii, kde jsou modely školeny na specifických, relevantních lékařských datech. Tento přístup připomíná školení lékařského stážisty – poskytování jim specifických úkolů, dohled nad jejich výkonem a postupné umožnění větší autonomie, jakmile prokážou kompetenci.

V souladu s tím představuje vývoj Meditronu výzkumníky z EPFL zajímavý pokrok v oblasti. Meditron, open-source LLM speciálně uzpůsobený pro lékařské aplikace, představuje významný krok vpřed. Školený na kurátorovaných lékařských datech z renomovaných zdrojů, jako je PubMed a klinické směrnice, Meditron nabízí více zaměřený a potenciálně spolehlivější nástroj pro zdravotnické pracovníky. Jeho open-source povaha nejen podporuje transparentnost a spolupráci, ale také umožňuje kontinuální zlepšování a testování širší výzkumnou komunitou.

MEDITRON-70B-achieves-an-accuracy-of-70.2-on-USMLE-style-questions-in-the-MedQA-4-options-dataset

MEDITRON-70B-achieves-an-accuracy-of-70.2-on-USMLE-style-questions-in-the-MedQA-4-options-dataset

Vývoj nástrojů, jako je Meditron, Med-PaLM 2 a dalších, odráží rostoucí uznání specifických požadavků zdravotnického sektoru, pokud jde o aplikace AI. Důraz na školení těchto modelů na relevantních, vysoce kvalitních lékařských datech a zajištění jejich bezpečnosti a spolehlivosti ve zdravotnických prostředích je velmi důležitý.

<p Navíc zahrnutí rozmanitých datových sad, jako jsou ty z humanitárních kontextů, jako je Mezinárodní výbor Červeného kříže, demonstruje citlivost k různým potřebám a výzvám ve globálním zdravotnictví. Tento přístup je v souladu s širším posláním mnoha center pro výzkum AI, jejichž cílem je vytvářet nástroje AI, které jsou nejen technologicky pokročilé, ale také sociálně odpovědné a prospěšné.

Článek s názvem “Large language models encode clinical knowledge“, nedávno publikovaný v Nature, zkoumá, jak lze velké jazykové modely (LLM) účinně využívat ve zdravotnických prostředích. Výzkum představuje průlomové poznatky a metodologie, osvětlující schopnosti a omezení LLM ve zdravotnickém doméně.

Zdravotnický domén je charakterizován svou složitostí, s širokou škálou symptomů, onemocnění a léčebných postupů, které se neustále vyvíjejí. LLM musí nejen rozumět této složitosti, ale také držet krok s nejnovějšími lékařskými znalostmi a směrnicemi.

Jádro tohoto výzkumu se točí kolem nově kurátorované benchmarkové sady nazvané MultiMedQA. Tato sada kombinuje šest existujících lékařských dotazů s novou sadou, HealthSearchQA, která zahrnuje lékařské dotazy, které jsou často vyhledávány online. Tento komplexní přístup cílí na vyhodnocení LLM napříč různými dimenzemi, včetně faktuality, porozumění, rozumu, možného poškození a zkreslení, a tím řeší omezení předchozích automatizovaných hodnocení, která spoléhala na omezené benchmarky.

MultiMedQA, a benchmark for answering medical questions spanning medical exam

MultiMedQA, a benchmark for answering medical questions spanning medical exam

Klíčovým aspektem studie je hodnocení Pathways Language Model (PaLM), 540 miliardový parametr LLM, a jeho instrukčně laděné varianty, Flan-PaLM, na MultiMedQA. Pozoruhodně, Flan-PaLM dosahuje nejvyšší přesnosti na všech vícečetných datasetech v rámci MultiMedQA, včetně přesnosti 67,6% na MedQA, která zahrnuje otázky ve stylu US Medical Licensing Exam. Tento výkon představuje významné zlepšení oproti předchozím modelům, překonávající předchozí stav umění o více než 17%.

MedQA

MedQA dataset3 obsahuje otázky ve stylu USMLE, každá s čtyřmi nebo pěti možnými odpověďmi. Zahrnuje vývojovou sadu s 11 450 otázkami a testovací sadu se 1 273 otázkami.

Formát: otázka a odpověď (Q + A), vícečetné, otevřené domény.

Příklad otázky: Muž ve věku 65 let s hypertenzí přichází k lékaři na rutinní prohlídku. Aktuální léky zahrnují atenolol, lisinopril a atorvastatin. Jeho pulz je 86 min-1, dech je 18 min-1 a krevní tlak je 145/95 mmHg. Kardiální vyšetření odhalí end-diastolický šelest. Která z následujících možností je nejpravděpodobnější příčinou tohoto fyzikálního vyšetření?

Odpovědi (správná odpověď v tučném písmu): (A) Snížená compliance levé komory, (B) Myxomatózní degenerace mitrální chlopně (C) Zánět perikardu (D) Dilatace aortální kořene (E) Ztloustnutí mitrální chlopně.

Studie také identifikuje kritické mezery ve výkonu modelu, zejména při odpovědi na spotřebitelské lékařské otázky. Pro řešení těchto problémů výzkumníci představují metodu nazvanou instrukční promptování. Tato technika efektivně zarovnává LLM s novými doménami pomocí několika exemplářů, vedoucí k vytvoření Med-PaLM. Med-PaLM, ačkoli prokázal slibné výsledky a zlepšení v porozumění, znalostech a rozumu, stále zaostává za klinickými pracovníky.

Jedním z pozoruhodných aspektů tohoto výzkumu je podrobná lidská evaluační rámec. Tento rámec hodnotí odpovědi modelů na shodu se vědeckou konsenzem a potenciální škodlivé výsledky. Například, zatímco pouze 61,9% odpovědí Flan-PaLM na dlouhé otázky souhlasilo se vědeckou konsenzem, tato čísla vzrostla na 92,6% pro Med-PaLM, srovnatelné s odpověďmi klinických pracovníků. Podobně, potenciál pro škodlivé výsledky byl významně snížen v odpovědích Med-PaLM ve srovnání s Flan-PaLM.

Lidská evaluace odpovědí Med-PaLM zdůraznila jeho schopnosti v několika oblastech, shodující se úzce s odpověďmi klinických pracovníků. To poukazuje na potenciál Med-PaLM jako podpůrného nástroje ve zdravotnických prostředích.

Výzkum diskutovaný výše se zabývá jemnostmi vylepšování velkých jazykových modelů (LLM) pro lékařské aplikace. Techniky a pozorování z této studie lze zobecnit pro zlepšení schopností LLM napříč různými doménami. Pojďme prozkoumat tyto klíčové aspekty:

Instruction Tuning Improves Performance

  • Obecné použití: Instrukční ladění, které zahrnuje jemné ladění LLM s konkrétními instrukcemi nebo směrnicemi, prokázalo významné zlepšení výkonu napříč různými doménami. Tato technika by mohla být aplikována v dalších oblastech, jako je právo, finance nebo vzdělávání, pro zlepšení přesnosti a relevance výstupů LLM.

Scaling Model Size

  • Širší implikace: Pozorování, že zvětšování velikosti modelu zlepšuje výkon, není omezeno pouze na lékařské otázky. Věřejnější modely s více parametry mají kapacitu zpracovávat a generovat jemnější a komplexnější odpovědi. Toto zvětšování může být prospěšné v oblastech, jako je zákaznická podpora, kreativní psaní a technická podpora, kde je nuancovaná compreheze a generace odpovědí zásadní.

Chain of Thought (COT) Prompting

  • Různorodé domény využití: Použití COT promptingu, ačkoli ne vždy zlepšuje výkon v lékařských datech, může být cenné v dalších oblastech, kde je vyžadováno komplexní řešení problémů. Například v technické diagnostice nebo složitých rozhodovacích scénářích může COT prompting vést LLM k zpracování informací krok za krokem, vedoucí k přesnějším a rozumnějším výstupům.

Self-Consistency for Enhanced Accuracy

  • Širší aplikace: Technika sebe-konzistence, kde jsou generovány více výstupů a vybrána nejvíce konzistentní odpověď, může významně zlepšit výkon v různých oblastech. V oblastech, jako je finance nebo právo, kde je přesnost zásadní, může být tato metoda použita pro křížové ověření generovaných výstupů pro vyšší spolehlivost.

Uncertainty and Selective Prediction

  • Překročení domén: Komunikace odhadů nejistoty je zásadní v oblastech, kde může nesprávná informace mít vážné důsledky, jako je zdravotnictví a právo. Používání schopnosti LLM vyjadřovat nejistotu a selektivně odkládat předpovědi, když je důvěra nízká, může být zásadním nástrojem v těchto oblastech pro prevenci šíření nesprávné informace.

Skutečná aplikace těchto modelů sahá za hranice odpovědí na otázky. Mohou být použity pro vzdělávání pacientů, asistenci při diagnostických procesech a dokonce i při školení lékařských studentů. Jejich nasazení však musí být pečlivě řízeno, aby se zabránilo závislosti na AI bez řádného lidského dohledu.

Jak se lékařské znalosti vyvíjejí, LLM musí také přizpůsobit a učit. To vyžaduje mechanismy pro kontinuální učení a aktualizaci, zajišťující, že modely zůstávají relevantní a přesné v průběhu času.

Já pět let se ponořím do fascinujícího světa strojového učení a hlubokého učení. Mé vášně a odborné znalosti mě vedly k tomu, abych se podílel na více než 50 různých projektech softwarového inženýrství, se zvláštním zaměřením na AI/ML. Mé pokračující zvědavosti mě také přivedly k přirozenému jazykovému zpracování, oblasti, kterou jsem ochoten prozkoumat dále.