Modele i platformy AI
Rewolucjonizacja ochrony zdrowia: Eksploracja wpływu i przyszłości dużych modeli językowych w medycynie
Integracja i zastosowanie dużych modeli językowych (LLM) w medycynie i ochronie zdrowia były tematem znacznego zainteresowania i rozwoju.
Jak zauważono na konferencji Healthcare Information Management and Systems Society oraz innych ważnych wydarzeniach, firmy takie jak Google (GOOGL ) prowadzą prace nad zbadaniem potencjału generatywnego AI w ochronie zdrowia. Ich inicjatywy, takie jak Med-PaLM 2, podkreślają ewoluujący krajobraz rozwiązań opartych na AI w ochronie zdrowia, szczególnie w obszarach takich jak diagnostyka, opieka nad pacjentami i efektywność administracyjna.
Med-PaLM 2, pionierski LLM w dziedzinie ochrony zdrowia, wykazał imponujące możliwości, osiągając poziom “eksperta” w pytaniach w stylu egzaminu licencyjnego w Stanach Zjednoczonych. Ten model, oraz podobne, obiecują rewolucjonizować sposób, w jaki pracownicy ochrony zdrowia dostęp do informacji i je wykorzystują, potencjalnie poprawiając dokładność diagnostyczną i efektywność opieki nad pacjentami.
Jednakże, wraz z tymi postępami, pojawiły się obawy dotyczące praktyczności i bezpieczeństwa tych technologii w środowiskach klinicznych. Na przykład, poleganie na ogromnych źródłach danych internetowych do szkolenia modeli, chociaż korzystne w niektórych kontekstach, nie zawsze jest odpowiednie lub niezawodne w celach medycznych. Jak zauważa Nigam Shah, PhD, MBBS, Chief Data Scientist dla Stanford Health Care, kluczowe pytania dotyczą wydajności tych modeli w rzeczywistych środowiskach medycznych i ich rzeczywistego wpływu na opiekę nad pacjentami i efektywność ochrony zdrowia.
Perspektywa dr. Shah’a podkreśla potrzebę bardziej dostosowanego podejścia do wykorzystania LLM w medycynie. Zamiast modeli o ogólnym przeznaczeniu, szkolonych na szerokich danych internetowych, sugeruje bardziej ukierunkowaną strategię, w której modele są szkolone na konkretnych, istotnych danych medycznych. To podejście przypomina szkolenie stażysty medycznego – zapewnienie im konkretnych zadań, nadzorowanie ich wydajności i stopniowe przyznawanie im większej autonomii, gdy wykazują się kompetencjami.
W zgodzie z tym, rozwój Meditronu przez badaczy z EPFL przedstawia interesujący postęp w tej dziedzinie. Meditron, model językowy o otwartym kodzie źródłowym, specjalnie opracowany do zastosowań medycznych, reprezentuje znaczący krok naprzód. Szkolony na starannie wyselekcjonowanych danych medycznych z renomowanych źródeł, takich jak PubMed i wytyczne kliniczne, Meditron oferuje bardziej ukierunkowane i potencjalnie bardziej niezawodne narzędzie dla praktyków medycznych. Jego otwarty kod źródłowy nie tylko promuje przejrzystość i współpracę, ale także umożliwia ciągłe doskonalenie i testowanie przez szerszą społeczność badawczą.
Rozwój narzędzi takich jak Meditron, Med-PaLM 2 i innych odzwierciedla rosnące uznanie dla unikalnych wymagań sektora ochrony zdrowia w odniesieniu do zastosowań AI. Podkreślenie szkolenia tych modeli na istotnych, wysokiej jakości danych medycznych oraz zapewnienie ich bezpieczeństwa i niezawodności w środowiskach klinicznych jest bardzo istotne.
Ponadto, uwzględnienie różnorodnych zbiorów danych, takich jak te z kontekstów humanitarnych, jak Międzynarodowy Komitet Czerwonego Krzyża, pokazuje wrażliwość na różne potrzeby i wyzwania w ochronie zdrowia na świecie. To podejście jest zgodne z szerszą misją wielu ośrodków badawczych AI, które mają na celu tworzenie narzędzi AI, które są nie tylko zaawansowane technologicznie, ale także społecznie odpowiedzialne i korzystne.
Artykuł zatytułowany “Large language models encode clinical knowledge” opublikowany w Nature, bada, jak duże modele językowe (LLM) mogą być skutecznie wykorzystywane w środowiskach klinicznych. Badanie przedstawia przełomowe spostrzeżenia i metody, rzucając światło na możliwości i ograniczenia LLM w dziedzinie medycznej.
Dziedzina medyczna charakteryzuje się swoją złożonością, z ogromną liczbą objawów, chorób i leczeń, które ciągle ewoluują. LLM muszą nie tylko zrozumieć tę złożoność, ale także nadążyć za najnowszą wiedzą medyczną i wytycznymi.
Podstawą tego badania jest nowo opracowany benchmark o nazwie MultiMedQA. Ten benchmark łączy sześć istniejących zbiorów danych z pytaniami medycznymi z nowym zbiorem, HealthSearchQA, który składa się z pytań medycznych często wyszukiwanych w internecie. To kompleksowe podejście ma na celu ocenę LLM w różnych wymiarach, w tym faktualności, zrozumienia, rozumowania, potencjalnej szkody i uprzedzeń, tym samym adresując ograniczenia poprzednich automatycznych ocen, które opierały się na ograniczonych benchmarkach.
Kluczowe w tym badaniu jest ocena Pathways Language Model (PaLM), modelu językowego o 540 miliardach parametrów, i jego wariantu z dostosowanymi instrukcjami, Flan-PaLM, na MultiMedQA. Niezwykle, Flan-PaLM osiąga najlepszą dokładność na wszystkich zestawach danych wielokrotnego wyboru w ramach MultiMedQA, w tym 67,6% dokładności na MedQA, który składa się z pytań w stylu egzaminu licencyjnego w Stanach Zjednoczonych. To osiągnięcie oznacza znaczącą poprawę w stosunku do poprzednich modeli, przewyższając poprzedni stan sztuki o ponad 17%.
MedQA
Format: pytanie i odpowiedź (Q + A), wielokrotny wybór, otwarta domena.
Przykładowe pytanie: 65-letni mężczyzna z nadciśnieniem przychodzi do lekarza na rutynowe badanie zdrowia. Aktualne leki to atenolol, lizynopryl i atorwastatyna. Tętno wynosi 86 na minutę, oddechy 18 na minutę, a ciśnienie krwi 145/95 mmHg. Badanie serca ujawnia szmery diastoliczne. Które z poniższych jest najbardziej prawdopodobną przyczyną tego badania fizykalnego?
Odpowiedzi (poprawna odpowiedź wytłuszczona): (A) Zmniejszona elastyczność lewej komory, (B) Zwyrodnienie mięśniowe mitralnego zastawku (C) Zapalenie osierdzia (D) Rozszerzenie aorty (E) Zgrubienie liści zastawki mitralnej.
Badanie również identyfikuje krytyczne luki w wydajności modelu, szczególnie w odpowiedziach na pytania medyczne konsumentów. Aby rozwiązać te problemy, badacze wprowadzają metodę zwaną dostosowaniem instrukcji. Ta technika efektywnie wyrównuje LLM do nowych dziedzin za pomocą kilku przykładów, prowadząc do stworzenia Med-PaLM. Model Med-PaLM, chociaż wykonuje obiecująco i pokazuje poprawę w zrozumieniu, przypomnieniu wiedzy i rozumowaniu, nadal jest gorszy w porównaniu z klinicystami.
Jednym z najbardziej godnych uwagi aspektów tego badania jest szczegółowa ramka oceny ludzkiej. Ta ramka ocenia odpowiedzi modeli pod kątem zgodności z konsensusem naukowym i potencjalnych szkodliwych skutków. Na przykład, podczas gdy tylko 61,9% odpowiedzi Flan-PaLM na długie pytania zgadzało się z konsensusem naukowym, ta liczba wzrosła do 92,6% dla Med-PaLM, porównywalna z odpowiedziami wygenerowanymi przez klinicystów. Podobnie, potencjał szkodliwych skutków został znacząco zmniejszony w odpowiedziach Med-PaLM w porównaniu z Flan-PaLM.
Ocena ludzka odpowiedzi Med-PaLM podkreśliła jego biegłość w kilku obszarach, ściśle współgrając z odpowiedziami wygenerowanymi przez klinicystów. To podkreśla potencjał Med-PaLM jako narzędzia wspomagającego w środowiskach klinicznych.
Badanie omawiane powyżej wnika w szczegóły poprawy dużych modeli językowych (LLM) dla zastosowań medycznych. Techniki i obserwacje z tego badania mogą być uogólnione, aby poprawić możliwości LLM w różnych dziedzinach. Zbadajmy te kluczowe aspekty:
Dostosowanie instrukcji poprawia wydajność
- Zastosowanie ogólne: Dostosowanie instrukcji, które obejmuje dostosowanie LLM z konkretnymi instrukcjami lub wytycznymi, wykazało znaczącą poprawę wydajności w różnych dziedzinach. Ta technika może być zastosowana w innych dziedzinach, takich jak prawo, finanse lub edukacja, aby poprawić dokładność i istotność wyjść LLM.
Skalowanie rozmiaru modelu
- Szersze implikacje: Obserwacja, że zwiększanie rozmiaru modelu poprawia wydajność, nie jest ograniczona do odpowiedzi na pytania medyczne. Większe modele, z większą liczbą parametrów, mają możliwość przetwarzania i generowania bardziej nuansowanych i złożonych odpowiedzi. To skalowanie może być korzystne w dziedzinach takich jak obsługa klienta, pisanie kreatywne i wsparcie techniczne, gdzie nuansowane zrozumienie i generowanie odpowiedzi są kluczowe.
Łańcuch myśli (COT) jako bodziec
- Zróżnicowane zastosowania: Użycie bodźca łańcucha myśli (COT), chociaż nie zawsze poprawiające wydajność w zestawach danych medycznych, może być cenne w innych dziedzinach, gdzie wymagane jest złożone rozwiązywanie problemów. Na przykład, w technicznych rozwiązywaniach problemów lub złożonych scenariuszach podejmowania decyzji, bodziec łańcucha myśli może nakierować LLM na przetwarzanie informacji krok po kroku, prowadząc do bardziej dokładnych i uzasadnionych wyjść.
Spójność własna dla poprawionej dokładności
- Szersze zastosowania: Technika spójności własnej, w której generowane są wiele wyjść i wybierana jest najbardziej spójna odpowiedź, może znacząco poprawić wydajność w różnych dziedzinach. W dziedzinach takich jak finanse lub prawo, gdzie dokładność jest niezwykle ważna, ta metoda może być użyta do weryfikacji wygenerowanych wyjść pod kątem większej niezawodności.
Niepewność i selektywna predykcja
- Przekrojowa istotność: Komunikowanie się o niepewności jest kluczowe w dziedzinach, w których dezinformacja może mieć poważne konsekwencje, takie jak ochrona zdrowia i prawo. Używanie możliwości LLM do wyrażania niepewności i selektywnego odmawiania predykcji, gdy zaufanie jest niskie, może być kluczowym narzędziem w tych dziedzinach, aby zapobiec rozpowszechnianiu nieprecyzyjnych informacji.
Rzeczywiste zastosowanie tych modeli wykracza poza odpowiedzi na pytania. Mogą one być używane do edukacji pacjentów, wspomagania procesów diagnostycznych i nawet w szkoleniu studentów medycyny. Jednak ich wdrożenie musi być starannie zarządzane, aby uniknąć polegania na AI bez odpowiedniej nadzoru ludzkiego.
Podczas gdy wiedza medyczna ewoluuje, LLM również muszą się adaptować i uczyć. To wymaga mechanizmów ciągłego uczenia i aktualizacji, zapewniając, że modele pozostają istotne i dokładne w czasie.














