Modelos e plataformas de IA
Revolucionando a Saúde: Explorando o Impacto e o Futuro dos Grandes Modelos de Linguagem em Medicina
A integração e aplicação de grandes modelos de linguagem (LLMs) em medicina e saúde tem sido um tópico de grande interesse e desenvolvimento.
Como notado na Conferência Global da Sociedade de Informação e Sistemas de Saúde e outros eventos notáveis, empresas como a Google (GOOGL ) estão liderando o caminho na exploração do potencial da inteligência artificial gerativa em saúde. Suas iniciativas, como o Med-PaLM 2, destacam a paisagem em evolução das soluções de saúde impulsionadas por IA, particularmente em áreas como diagnósticos, cuidados ao paciente e eficiência administrativa.
O Med-PaLM 2 da Google, um modelo de linguagem pioneiro no domínio da saúde, demonstrou capacidades impressionantes, notadamente alcançando um nível “especialista” em questões do estilo do Exame de Licenciamento Médico dos EUA. Esse modelo, e outros semelhantes, prometem revolucionar a forma como os profissionais de saúde acessam e utilizam informações, potencialmente melhorando a precisão diagnóstica e a eficiência dos cuidados ao paciente.
No entanto, ao lado desses avanços, preocupações sobre a praticidade e segurança dessas tecnologias em ambientes clínicos foram levantadas. Por exemplo, a dependência de vastas fontes de dados da internet para o treinamento de modelos, embora benéfica em alguns contextos, pode não ser sempre apropriada ou confiável para fins médicos. Como Nigam Shah, PhD, MBBS, Cientista de Dados Chefe do Stanford Health Care, destaca, as questões cruciais a serem feitas são sobre o desempenho desses modelos em ambientes médicos reais e seu impacto real nos cuidados ao paciente e na eficiência da saúde.
A perspectiva do Dr. Shah destaca a necessidade de uma abordagem mais personalizada para utilizar LLMs em medicina. Em vez de modelos de propósito geral treinados em dados amplos da internet, ele sugere uma estratégia mais focada, onde os modelos são treinados em dados médicos específicos e relevantes. Essa abordagem se assemelha ao treinamento de um internato médico – fornecendo-lhes tarefas específicas, supervisionando seu desempenho e gradualmente permitindo mais autonomia à medida que demonstram competência.
Em linha com isso, o desenvolvimento do Meditron por pesquisadores da EPFL apresenta um avanço interessante no campo. O Meditron, um modelo de linguagem de código aberto especificamente projetado para aplicações médicas, representa um passo significativo à frente. Treinado em dados médicos curados de fontes confiáveis como o PubMed e diretrizes clínicas, o Meditron oferece uma ferramenta mais focada e potencialmente mais confiável para os profissionais de saúde. Sua natureza de código aberto não apenas promove transparência e colaboração, mas também permite melhoria contínua e testes de estresse pela comunidade de pesquisa mais ampla.
O desenvolvimento de ferramentas como o Meditron, Med-PaLM 2 e outras reflete um reconhecimento crescente das necessidades únicas do setor de saúde quando se trata de aplicações de IA. A ênfase no treinamento desses modelos em dados médicos relevantes e de alta qualidade, e garantir sua segurança e confiabilidade em ambientes clínicos, é crucial.
Além disso, a inclusão de conjuntos de dados diversificados, como os de contextos humanitários como o Comitê Internacional da Cruz Vermelha, demonstra uma sensibilidade às necessidades e desafios variados na saúde global. Essa abordagem alinha-se com a missão mais ampla de muitos centros de pesquisa de IA, que visam criar ferramentas de IA que não apenas sejam tecnologicamente avançadas, mas também socialmente responsáveis e benéficas.
O artigo intitulado “Large language models encode clinical knowledge” publicado recentemente na Nature, explora como os grandes modelos de linguagem (LLMs) podem ser efetivamente utilizados em ambientes clínicos. A pesquisa apresenta insights e metodologias inovadoras, lançando luz sobre as capacidades e limitações dos LLMs no domínio médico.
O domínio médico é caracterizado por sua complexidade, com uma vasta gama de sintomas, doenças e tratamentos que estão constantemente evoluindo. Os LLMs devem não apenas entender essa complexidade, mas também manter-se atualizados com os últimos conhecimentos e diretrizes médicas.
O núcleo dessa pesquisa gira em torno de um novo benchmark curado chamado MultiMedQA. Esse benchmark combina seis conjuntos de dados de resposta a perguntas médicas existentes com um novo conjunto de dados, o HealthSearchQA, que compreende perguntas médicas frequentemente pesquisadas online. Essa abordagem abrangente visa avaliar os LLMs em várias dimensões, incluindo factualidade, compreensão, raciocínio, possível dano e viés, abordando assim as limitações das avaliações automatizadas anteriores que confiavam em benchmarks limitados.
Chave para o estudo é a avaliação do Pathways Language Model (PaLM), um LLM de 540 bilhões de parâmetros, e sua variante de treinamento de instruções, o Flan-PaLM, no MultiMedQA. Notavelmente, o Flan-PaLM alcança precisão de estado da arte em todos os conjuntos de dados de múltipla escolha dentro do MultiMedQA, incluindo uma precisão de 67,6% no MedQA, que compreende perguntas no estilo do Exame de Licenciamento Médico dos EUA. Esse desempenho marca uma melhoria significativa sobre os modelos anteriores, superando o estado da arte anterior em mais de 17%.
MedQA
Formato: pergunta e resposta (Q + A), múltipla escolha, domínio aberto.
Pergunta de exemplo: Um homem de 65 anos com hipertensão vem ao médico para um exame de manutenção de saúde de rotina. Os medicamentos atuais incluem atenolol, lisinopril e atorvastatina. Sua pulsação é de 86 min−1, respirações são de 18 min−1 e pressão arterial é de 145/95 mmHg. O exame cardíaco revela um murmúrio diastólico. Qual das seguintes é a causa mais provável desse exame físico?
Respostas (resposta correta em negrito): (A) Redução da complacência do ventrículo esquerdo, (B) Degeneração mixomatosa da valva mitral (C) Inflamação do pericárdio (D) Dilatação da raiz aórtica (E) Espessamento das valvas mitrais.
O estudo também identifica lacunas críticas no desempenho do modelo, especialmente em responder perguntas médicas de consumidores. Para abordar essas questões, os pesquisadores introduzem um método conhecido como ajuste de prompt de instrução. Essa técnica alinha eficientemente os LLMs a novos domínios usando poucos exemplares, resultando na criação do Med-PaLM. O modelo Med-PaLM, embora apresente desempenho encorajador e mostre melhoria na compreensão, lembrança de conhecimento e raciocínio, ainda fica aquém em comparação com clínicos.
Um aspecto notável dessa pesquisa é o quadro de avaliação humana detalhado. Esse quadro avalia as respostas dos modelos para concordância com o consenso científico e resultados potencialmente prejudiciais. Por exemplo, enquanto apenas 61,9% das respostas de longo prazo do Flan-PaLM estavam alinhadas com o consenso científico, essa figura subiu para 92,6% para o Med-PaLM, comparável às respostas geradas por clínicos. Da mesma forma, o potencial para resultados prejudiciais foi significativamente reduzido nas respostas do Med-PaLM em comparação com o Flan-PaLM.
A avaliação humana das respostas do Med-PaLM destacou sua proficiência em várias áreas, alinhando-se estreitamente com respostas geradas por clínicos. Isso sublinha o potencial do Med-PaLM como uma ferramenta de apoio em ambientes clínicos.
A pesquisa discutida acima mergulha nas complexidades de melhorar os Grandes Modelos de Linguagem (LLMs) para aplicações médicas. As técnicas e observações desse estudo podem ser generalizadas para melhorar as capacidades dos LLMs em vários domínios. Vamos explorar esses aspectos chave:
Ajuste de Instrução Melhora o Desempenho
- Aplicação Geralizada: O ajuste de instrução, que envolve o ajuste fino dos LLMs com instruções ou diretrizes específicas, mostrou melhorar significativamente o desempenho em vários domínios. Essa técnica pode ser aplicada a outros campos, como legais, financeiros ou educacionais, para melhorar a precisão e a relevância das saídas dos LLMs.
Escalando o Tamanho do Modelo
- Implicações Mais Amplas: A observação de que o aumento do tamanho do modelo melhora o desempenho não se limita à resposta a perguntas médicas. Modelos maiores, com mais parâmetros, têm a capacidade de processar e gerar respostas mais nuances e complexas. Essa escalabilidade pode ser benéfica em domínios como atendimento ao cliente, redação criativa e suporte técnico, onde a compreensão e a geração de respostas nuances são cruciais.
Encadeamento de Pensamento (COT) para Prompt
- Utilização em Diversos Domínios: O uso do encadeamento de pensamento (COT) para prompt, embora nem sempre melhore o desempenho em conjuntos de dados médicos, pode ser valioso em outros domínios onde a resolução de problemas complexos é necessária. Por exemplo, em cenários de solução de problemas técnicos ou tomada de decisões complexas, o COT pode guiar os LLMs a processar informações passo a passo, levando a saídas mais precisas e razoáveis.
Autoconsistência para Precisão Aumentada
- Aplicações Mais Amplas: A técnica de autoconsistência, onde várias saídas são geradas e a resposta mais consistente é selecionada, pode melhorar significativamente o desempenho em vários campos. Em domínios como finanças ou legais, onde a precisão é fundamental, esse método pode ser usado para verificar a confiabilidade das saídas geradas.
Incerteza e Previsão Seletiva
- Relevância Transversal: Comunicar estimativas de incerteza é crucial em campos onde a disseminação de informações erradas pode ter consequências graves, como saúde e direito. Usar a capacidade dos LLMs de expressar incerteza e se abster de previsões quando a confiança é baixa pode ser uma ferramenta crucial nesses domínios para prevenir a disseminação de informações imprecisas.
A aplicação prática desses modelos se estende além da resposta a perguntas. Eles podem ser usados para educação do paciente, auxílio nos processos de diagnóstico e até mesmo no treinamento de estudantes de medicina. No entanto, seu desdobramento deve ser cuidadosamente gerenciado para evitar a dependência da IA sem a devida supervisão humana.
À medida que o conhecimento médico evolui, os LLMs também devem se adaptar e aprender. Isso requer mecanismos para aprendizado contínuo e atualização, garantindo que os modelos permaneçam relevantes e precisos ao longo do tempo.














