Neural Language Models in Clinical Practice: A Case Study on Chronic Kidney Disease Consultations
Nome: VICTOR NASCIMENTO NEVES
Data de publicação: 02/09/2025
Banca:
| Nome |
Papel |
|---|---|
| ALBERTO FERREIRA DE SOUZA | Presidente |
| ANDRE GEORGHTON CARDOSO PACHECO | Examinador Interno |
| CLAUDINE SANTOS BADUE | Coorientador |
| FRANCISCO DE ASSIS BOLDT | Examinador Externo |
Resumo: Este estudo apresenta uma estrutura computacional para integrar Modelos de Linguagem de Grande Porte (LLMs), baseados em transformers, à prática clínica em nefrologia, com o objetivo de auxiliar na transcrição, no raciocínio diagnóstico e na documentação. Gravações de áudio de 34 consultas de pacientes com doença renal crônica (DRC) foram pré-processadas, transcritas com o Whisper e refinadas pelo GPT-4o, de modo a garantir atribuição correta dos falantes, precisão terminológica médica e coerência contextual. As transcrições refinadas foram combinadas com dados estruturados dos pacientes, incluindo resultados laboratoriais e de imagem, para que o GPT-4o gerasse hipóteses diagnósticas, impressões clínicas e condutas sugeridas.
O desempenho da transcrição, avaliado com ROUGE-L F1 e similaridade cosseno, alcançou valores médios de F1 de 0,42 para falas de pacientes, 0,54 para falas da equipe médica e 0,60 no total, com similaridades correspondentes de 0,76, 0,89 e 0,91. A ingestão de dados estruturados dos pacientes mostrou-se essencial para aumentar a robustez do raciocínio subsequente, especialmente em casos nos quais gravações ruidosas reduziram o recall.
A avaliação clínica das saídas, realizada pelos modelos OpenBioLLM-70B e DeepSeek v3, classificou a maioria dos resultados como alinhados às avaliações médicas ou como interpretações alternativas válidas, havendo casos em que um avaliador preferiu a saída do médico e o outro a do GPT-4o. O DeepSeek v3, modelo generalista de maior capacidade, demonstrou avaliações mais consistentes e rigorosas que o modelo menor e treinado em domínio específico, o OpenBioLLM-70B, sugerindo que a escala e a habilidade de raciocínio do modelo podem superar o treinamento especializado para fins de avaliação.
Os resultados indicam que pipelines baseados em LLMs podem reduzir a carga administrativa dos clínicos sem comprometer a relevância clínica das saídas. A abordagem proposta demonstra potencial para implantação em fluxos de trabalho reais, desde que supervisão humana e validação por especialistas de domínio permaneçam como componentes centrais do processo.
