Модели и платформы ИИ

Революционизация здравоохранения: изучение влияния и будущего крупномасштабных языковых моделей в медицине

mm
Добавьте Unite.AI в избранные источники в Google

Интеграция и применение крупномасштабных языковых моделей (КЯМ) в медицине и здравоохранении является темой значительного интереса и развития.

Как отмечалось на конференции Healthcare Information Management and Systems Society и других заметных мероприятиях, компании như Google (GOOGL ) возглавляют движение по изучению потенциала генеративного ИИ в здравоохранении. Их инициативы, такие как Med-PaLM 2, подчеркивают эволюционирующий ландшафт решений для здравоохранения на основе ИИ, особенно в таких областях, как диагностика, уход за пациентами и административная эффективность.

Med-PaLM 2 от Google, пионерская КЯМ в области здравоохранения, продемонстрировала впечатляющие возможности, достигнув уровня “эксперта” в вопросах, подобных экзаменам на медицинскую лицензию в США. Эта модель и другие подобные ей обещают революционизировать способ, которым медицинские работники получают и используют информацию, потенциально повышая точность диагностики и эффективность ухода за пациентами.

Однако вместе с этими достижениями были высказаны опасения по поводу практичности и безопасности этих технологий в клинических условиях. Например, зависимость от огромных источников данных интернета для обучения моделей, хотя и полезна в некоторых контекстах, не всегда может быть подходящей или надежной для медицинских целей. Как отметил Нигам Шах, PhD, MBBS, главный ученый-дата в Stanford Health Care, важными вопросами являются производительность этих моделей в реальных медицинских условиях и их фактическое влияние на уход за пациентами и эффективность здравоохранения.

Точка зрения доктора Шаха подчеркивает необходимость более адаптированного подхода к использованию КЯМ в медицине. Вместо общих моделей, обученных на широких интернет-данных, он предлагает более сосредоточенную стратегию, при которой модели обучаются на конкретных, актуальных медицинских данных. Этот подход напоминает обучение медицинского интерна – предоставление им конкретных задач, наблюдение за их работой и постепенное предоставление большей автономии по мере демонстрации компетентности.

В соответствии с этим, разработка Meditron исследователями EPFL представляет собой интересное достижение в этой области. Meditron, открытая КЯМ, специально разработанная для медицинских приложений, представляет собой значительный шаг вперед. Обученная на отобранных медицинских данных из авторитетных источников, таких как PubMed и клинические рекомендации, Meditron предлагает более сосредоточенный и потенциально более надежный инструмент для медицинских работников. Его открытая природа не только способствует прозрачности и сотрудничеству, но также позволяет осуществлять непрерывное совершенствование и тестирование более широким исследовательским сообществом.

MEDITRON-70B-achieves-an-accuracy-of-70.2-on-USMLE-style-questions-in-the-MedQA-4-options-dataset

MEDITRON-70B-achieves-an-accuracy-of-70.2-on-USMLE-style-questions-in-the-MedQA-4-options-dataset

Разработка инструментов, таких как Meditron, Med-PaLM 2 и других, отражает растущее признание уникальных требований сектора здравоохранения в отношении приложений ИИ. Акцент на обучении этих моделей на актуальных, высококачественных медицинских данных и обеспечении их безопасности и надежности в клинических условиях является очень важным.

Более того, включение разнообразных наборов данных, таких как те, которые получены из гуманитарных контекстов, таких как Международный комитет Красного Креста, демонстрирует чувствительность к различным потребностям и проблемам в глобальном здравоохранении. Этот подход соответствует более широкой миссии многих центров исследований ИИ, которые стремятся создавать инструменты ИИ, которые не только технологически продвинуты, но и социально ответственны и полезны.

Статья под названием “Крупномасштабные языковые модели кодируют клинические знания“, недавно опубликованная в Nature, исследует, как крупномасштабные языковые модели (КЯМ) могут быть эффективно использованы в клинических условиях. Исследование представляет новаторские идеи и методологии, проливая свет на возможности и ограничения КЯМ в медицинской области.

Медицинская область характеризуется своей сложностью, с огромным количеством симптомов, заболеваний и методов лечения, которые постоянно эволюционируют. КЯМ должны не только понимать эту сложность, но и идти в ногу с последними медицинскими знаниями и рекомендациями.

Ядро этого исследования вращается вокруг новой, тщательно подобранной оценки, называемой MultiMedQA. Эта оценка объединяет шесть существующих наборов данных вопросов и ответов с новым набором данных, HealthSearchQA, который состоит из медицинских вопросов, часто ищущихся в интернете. Этот комплексный подход направлен на оценку КЯМ по различным измерениям, включая фактичность, понимание, рассуждение, возможный вред и предвзятость, тем самым решая ограничения предыдущих автоматических оценок, которые полагались на ограниченные оценки.

MultiMedQA, оценка для ответов на медицинские вопросы, охватывающую медицинские экзамены

MultiMedQA, оценка для ответов на медицинские вопросы, охватывающую медицинские экзамены

Ключевым в этом исследовании является оценка модели Pathways Language Model (PaLM), 540-миллиардной параметрической КЯМ, и ее варианта, обученного на инструкциях, Flan-PaLM, на MultiMedQA. Замечательно, что Flan-PaLM достигает лучшей точности на всех множественных выборах наборов данных внутри MultiMedQA, включая точность 67,6% на MedQA, который состоит из вопросов, подобных экзаменам на медицинскую лицензию в США. Это выступление отмечает значительное улучшение по сравнению с предыдущими моделями, превосходя предыдущее состояние искусства более чем на 17%.

MedQA

Набор данных MedQA3 включает вопросы, стилизованные под экзамен на медицинскую лицензию в США, каждый с четырьмя или пятью вариантами ответа. Он включает набор разработки с 11 450 вопросами и набор тестирования, состоящий из 1 273 вопросов.

Формат: вопрос и ответ (Q + A), множественный выбор, открытая область.

Пример вопроса: 65-летний мужчина с гипертонией приходит к врачу для планового медицинского осмотра. Текущие лекарства включают атенолол, лизиноприл и аторвастатин. Его пульс составляет 86 мин-1, дыхание - 18 мин-1, а артериальное давление - 145/95 мм рт. ст. Кардиологический осмотр выявляет эндодиастолический шум. Какое из следующих является наиболее вероятной причиной этого физического осмотра?

Ответы (правильный ответ в жирном шрифте): (А) Снижение жесткости левого желудочка, (Б) Мioxоматозная дегенерация митрального клапана (В) Воспаление перикарда (Г) Расширение корня аорты (Д) Утолщение листков митрального клапана.

Исследование также выявляет критические пробелы в производительности модели, особенно при ответах на вопросы потребителей. Для решения этих проблем исследователи вводят метод, известный как настройка инструкций. Этот метод эффективно выравнивает КЯМ с новыми областями с помощью нескольких примеров, в результате чего создается Med-PaLM. Модель Med-PaLM, хотя и показывает обнадеживающие результаты и демонстрирует улучшение в понимании, припоминании знаний и рассуждении, все же отстает от показателей клиницистов.

Заметным аспектом этого исследования является подробная оценка, проводимая людьми. Эта оценка оценивает ответы моделей на соответствие научному консенсусу и потенциальные вредные последствия. Например, хотя только 61,9% ответов Flan-PaLM в длинной форме соответствовали научному консенсусу, эта цифра возросла до 92,6% для Med-PaLM, что сопоставимо с ответами, сгенерированными клиницистами. Аналогично, потенциал вредных последствий был значительно снижен в ответах Med-PaLM по сравнению с Flan-PaLM.

Оценка, проведенная людьми, ответов Med-PaLM подчеркнула его компетентность в нескольких областях, соответствующую ответам, сгенерированным клиницистами. Это подчеркивает потенциал Med-PaLM в качестве поддерживающего инструмента в клинических условиях.

Исследование, обсуждаемое выше, углубляется в тонкости улучшения крупномасштабных языковых моделей (КЯМ) для медицинских приложений. Техники и наблюдения из этого исследования могут быть обобщены для улучшения возможностей КЯМ в различных областях. Давайте рассмотрим эти ключевые аспекты:

Настройка инструкций улучшает производительность

  • Обобщенная применимость: Настройка инструкций, которая включает в себя тонкую настройку КЯМ с помощью конкретных инструкций или рекомендаций, показала значительное улучшение производительности в различных областях. Этот метод может быть применен к другим областям, таким как юридическая, финансовая или образовательная, для улучшения точности и актуальности выходных данных КЯМ.

Масштабирование размера модели

  • Более широкие последствия: Наблюдение, что масштабирование размера модели улучшает производительность, не ограничивается медицинскими вопросами и ответами. Более крупные модели, с большим количеством параметров, имеют возможность обрабатывать и генерировать более тонкие и сложные ответы. Это масштабирование может быть полезным в областях, таких как обслуживание клиентов, творческое письмо и техническая поддержка, где нюансовое понимание и генерация ответов являются важными.

Цепочка мысли (COT) подсказки

  • Разнообразные области применения: Использование подсказок COT, хотя и не всегда улучшающих производительность в медицинских наборах данных, может быть ценным в других областях, где требуется сложное решение проблем. Например, в технической поддержке или сложных сценариях принятия решений подсказки COT могут направлять КЯМ на обработку информации шаг за шагом, что приводит к более точным и обоснованным выходным данным.

Самосогласованность для повышения точности

  • Более широкие применения: Техника самосогласованности, при которой генерируются несколько выходных данных и выбирается наиболее последовательный ответ, может значительно улучшить производительность в различных областях. В областях, таких как финансы или право, где точность имеет первостепенное значение, этот метод может быть использован для проверки сгенерированных выходных данных на более высокую надежность.

Неопределенность и избирательное прогнозирование

  • Пересечение областей: Передача оценок неопределенности является важной в областях, где дезинформация может иметь серьезные последствия, такие как здравоохранение и право. Использование возможности КЯМ выражать неопределенность и избирательно откладывать прогнозы, когда уверенность низка, может быть важным инструментом в этих областях для предотвращения распространения неточной информации.

Реальное применение этих моделей выходит за рамки ответов на вопросы. Они могут быть использованы для образования пациентов, помощи в диагностических процессах и даже в обучении медицинских студентов. Однако их развертывание должно быть тщательно управляемо, чтобы избежать зависимости от ИИ без надлежащего человеческого надзора.

По мере эволюции медицинских знаний КЯМ также должны адаптироваться и учиться. Это требует механизмов для непрерывного обучения и обновления, гарантируя, что модели остаются актуальными и точными во времени.

Я провел последние пять лет, погружаясь в увлекательный мир машинного обучения и глубокого обучения. Моя страсть и экспертиза привели меня к участию в более чем 50 различных проектах программной инженерии, с особым акцентом на ИИ/МО. Мое непрекращающееся любопытство также привело меня к обработке естественного языка, области, которую я с нетерпением жду возможности изучить дальше.