Моделі та платформи ШІ

Революціонізування охорони здоров’я: дослідження впливу та майбутнього великих мовних моделей у медицині

mm
Додайте Unite.AI до бажаних джерел у Google

Інтеграція та застосування великих мовних моделей (LLM) у медицині та охороні здоров’я є темою значного інтересу та розвитку.

Як зазначено на конференції Healthcare Information Management and Systems Society та інших відомих подіях, компанії як Google (GOOGL ) очолюють розвиток потенціалу генеративного ІІ у сфері охорони здоров’я. Їхні ініціативи, такі як Med-PaLM 2, підкреслюють еволюцію ландшафту рішень у сфері охорони здоров’я, особливо в таких областях, як діагностика, лікування пацієнтів та адміністративна ефективність.

Med-PaLM 2 від Google, піонерська LLM у сфері охорони здоров’я, продемонструвала вражаючі можливості, зокрема досягнувши рівня “експерта” у питаннях, подібних до тих, що використовуються під час медичної ліцензійної експертизи у США. Ця модель та інші подібні їй обіцяють революціонізувати спосіб, яким медичні працівники отримують та використовують інформацію, потенційно підвищуючи точність діагностики та ефективність лікування пацієнтів.

Однак, поряд з цими досягненнями, виникли побоювання щодо практичності та безпеки цих технологій у клінічних умовах. Наприклад, залежність від величезних джерел інтернет-даних для навчання моделей, хоча й корисна в деяких контекстах, не завжди є придатною або надійною для медичних цілей. Як зазначає Нігам Шах, PhD, MBBS, головний науковий працівник Stanford Health Care, ключові питання полягають у тому, як ці моделі працюють у реальних медичних умовах та який їхній фактичний вплив на лікування пацієнтів та ефективність охорони здоров’я.

Відповідь доктора Шаха підкреслює необхідність більш цілеспрямованого підходу до використання LLM у медицині. Замість загальних моделей, навчених на широких інтернет-даних, він пропонує більш фокусований підхід, при якому моделі навчаються на конкретних, актуальних медичних даних. Цей підхід нагадує навчання медичного інтерна – надання їм конкретних завдань, нагляд за їхньою роботою та поступове надання їм більшої автономії, коли вони демонструють компетентність.

У відповідності з цим, розробка Meditron дослідниками EPFL представляє цікавий крок вперед у цій сфері. Meditron, відкрита LLM, спеціально розроблена для медичних застосунків, являє собою значний крок вперед. Навчена на відібраних медичних даних з авторитетних джерел, таких як PubMed та клінічні рекомендації, Meditron пропонує більш фокусований і потенційно більш надійний інструмент для медичних працівників. Її відкрита природа не тільки сприяє прозорості та співробітництву, але також дозволяє дослідницькій спільноті постійно покращувати та тестирувати її.

MEDITRON-70B-achieves-an-accuracy-of-70.2-on-USMLE-style-questions-in-the-MedQA-4-options-dataset

MEDITRON-70B-achieves-an-accuracy-of-70.2-on-USMLE-style-questions-in-the-MedQA-4-options-dataset

Розробка інструментів, таких як Meditron, Med-PaLM 2 та інших, відображає зростаюче визнання унікальних вимог до сфери охорони здоров’я щодо застосунків ІІ. Акцент на навчанні цих моделей на актуальних, високоякісних медичних даних та забезпечення їхньої безпеки та надійності у клінічних умовах є дуже важливим.

Крім того, включення різноманітних наборів даних, таких як ті, що походять з гуманітарних контекстів, таких як Міжнародний комітет Червоного Хреста, демонструє чутливість до різноманітних потреб та викликів у глобальній охороні здоров’я. Цей підхід узгоджується з більш широкою місією багатьох центрів досліджень ІІ, які спрямовані на створення інструментів ІІ, які є не тільки технологічно просунутими, але й соціально відповідальними та корисними.

Стаття під назвою “Large language models encode clinical knowledge“, опублікована у Nature, досліджує, як великі мовні моделі (LLM) можуть бути ефективно використані у клінічних умовах. Дослідження представляє новаторські ідеї та методи, проливаючи світло на можливості та обмеження LLM у медичній сфері.

Медична сфера характеризується своєю складністю, з великою кількістю симптомів, захворювань та методів лікування, які постійно еволюціонують. LLM повинні не тільки зрозуміти цю складність, але й бути в змозі слідкувати за останніми медичними знаннями та рекомендаціями.

Саме дослідження обертається навколо новоствореного бенчмарка під назвою MultiMedQA. Цей бенчмарк об’єднує шість існуючих медичних наборів даних з питань-відповідей з новим набором даних, HealthSearchQA, який складається з медичних питань, часто шуканих в інтернеті. Цей комплексний підхід спрямований на оцінку LLM у різних вимірах, включаючи фактичність, розуміння, висновок, можливу шкоду та упередженість, тим самим вирішуючи обмеження попередніх автоматизованих оцінок, які спиралися на обмежені бенчмарки.

MultiMedQA, a benchmark for answering medical questions spanning medical exam

MultiMedQA, a benchmark for answering medical questions spanning medical exam

Ключем до дослідження є оцінка Pathways Language Model (PaLM), 540-мільярдного параметра LLM, та його варіанту, налаштованого за інструкціями, Flan-PaLM, на MultiMedQA. Вражаюче, Flan-PaLM досягає найвищої точності на всіх множинних вибірних наборах даних у рамках MultiMedQA, включаючи точність 67,6% на MedQA, який складається з питань, подібних до тих, що використовуються під час медичної ліцензійної експертизи у США. Ця продуктивність відзначає значне покращення порівняно з попередніми моделями, перевершуючи попередній рівень на понад 17%.

MedQA

Набір даних MedQA3 містить питання, стилізовані під USMLE, кожне з чотирма або п’ятьма варіантами відповідей. Він включає набір розробки з 11 450 питаннями та тестовий набір, що складається з 1 273 питань.

Формат: питання та відповідь (Q + A), множинний вибір, відкрита область.

Приклад питання: 65-річний чоловік з гіпертонією звертається до лікаря для регулярного медичного огляду. Поточні ліки включають атенолол, лізиноприл та аторвастатин. Його пульс — 86 уд/хв, дихання — 18 уд/хв, артеріальний тиск — 145/95 мм рт. ст. Кардіологічний огляд виявляє діастолічний шум. Яке з наступного є найбільш імовірною причиною цього фізичного огляду?

Відповіді (правильна відповідь виділена жирним шрифтом): (A) Зменшена пружність лівого шлуночка, (B) міксоматозна дегенерація мітрального клапана (C) Запалення перикарда (D) Розширення аортального коріння (E) Загустіння мітрального клапанного листка.

Дослідження також визначає критичні пробіли у продуктивності моделі, особливо у відповідях на питання споживачів. Для вирішення цих питань дослідники вводять метод, відомий як налаштування інструкцій. Ця техніка ефективно спрямовує LLM на нові області за допомогою декількох прикладів, що призводить до створення Med-PaLM. Модель Med-PaLM, хоча й демонструє перспективи та покращення у розумінні, запам’ятовуванні знань та висновках, все ж таки поступається клініцистам.

Одним з найважливіших аспектів цього дослідження є детальна рамка оцінки людьми. Ця рамка оцінює відповіді моделей на узгодженість з науковим консенсусом та потенційну шкоду. Наприклад, хоча лише 61,9% довгих відповідей Flan-PaLM узгоджувалися з науковим консенсусом, ця цифра зросла до 92,6% для Med-PaLM, порівняно з відповідями клініцистів. Аналогічно, потенційна шкода була суттєво знижена у відповідях Med-PaLM порівняно з Flan-PaLM.

Оцінка людьми відповідей Med-PaLM підкреслила її компетентність у кількох областях, узгоджуючись із відповідями клініцистів. Це підкреслює потенціал Med-PaLM як інструменту підтримки у клінічних умовах.

Дослідження, обговорене вище, занурюється у тонкощі покращення великих мовних моделей (LLM) для медичних застосунків. Техніки та спостереження з цього дослідження можуть бути узагальнені для покращення можливостей LLM у різних областях. Давайте розглянемо ці ключові аспекти:

Налаштування інструкцій покращує продуктивність

  • Загальне застосування: Налаштування інструкцій, яке включає доналаштування LLM з конкретними інструкціями або рекомендаціями, показало значне покращення продуктивності у різних областях. Ця техніка може бути застосована до інших сфер, таких як юридична, фінансова або освітня, для покращення точності та актуальності виводів LLM.

Масштабування розміру моделі

  • Ширші наслідки: Спостереження, що збільшення розміру моделі покращує продуктивність, не обмежується медичними питаннями-відповідями. Більші моделі, з більшою кількістю параметрів, мають потенціал обробляти та генерувати більш тонкі та складні відповіді. Це масштабування може бути корисним у сферах, таких як обслуговування клієнтів, творче письмо та технічна підтримка, де нюансироване розуміння та генерація відповідей є важливими.

Ланцюг думок (COT) промптинг

  • Різноманітні області застосування: Використання COT промптингу, хоча не завжди покращує продуктивність у медичних наборах даних, може бути цінним у інших областях, де потрібне складне розв’язання проблем. Наприклад, у технічній підтримці або складних сценаріях прийняття рішень COT промптинг може спрямовувати LLM на обробку інформації крок за кроком, що призводить до більш точних та обґрунтованих виводів.

Самоузгодженість для покращення точності

  • Ширші застосування: Техніка самоузгодженості, при якій генеруються декілька виводів та вибирається найбільш узгоджена відповідь, може суттєво покращити продуктивність у різних сферах. У галузях, таких як фінанси або право, де точність є найважливішою, цей метод може бути використаний для перехресної верифікації згенерованих виводів для вищої надійності.

Невизначеність та вибіркова передбачення

  • Перехресна актуальність: Передача оцінок невизначеності є важливою у галузях, де неправильна інформація може мати серйозні наслідки, як-от охорона здоров’я та право. Використання можливостей LLM виражати невизначеність та вибірково утримувати передбачення, коли впевненість низька, може бути важливим інструментом у цих галузях для запобігання поширення неточної інформації.

Фактичне застосування цих моделей виходить за рамки відповідей на питання. Вони можуть бути використані для освіти пацієнтів, допомоги у діагностичних процесах та навіть у навчанні медичних студентів. Однак їхнє розгортання повинно бути ретельно кероване, щоб уникнути залежності від ІІ без належного людського нагляду.

Оскільки медичні знання еволюціонують, LLM також повинні адаптуватися та навчатися. Це вимагає механізмів для безперервного навчання та оновлення, забезпечення того, щоб моделі залишалися актуальними та точними з часом.

Я провів останні п'ять років, занурючись у захопливий світ машинного навчання та глибокого навчання. Моя пристрасть та експертиза привели мене до внеску у понад 50 різних проектів програмної інженерії, з особливим акцентом на AI/ML. Моя тривала цікавість також привела мене до природної обробки мови, галузі, яку я бажаю дослідити далі.