-
Usando aprendizado de máquina para otimizar revisões sistemáticas de literatura
- Voltar
Título
Usando aprendizado de máquina para otimizar revisões sistemáticas de literatura
Tipo de documento
Pôster
Descrição
Resumo apresentado na Health Technology Assessment international (HTAi)
Fonte
HTAi
Ano de publicação
2024
Referência (Vancouver)
Chacko A. Using machine learning to optimize systematic literature reviews. In: HTAi Annual Meeting Abstract Book; 2024 Dec; Seville, Spain. Health Technology Assessment International, HTAi; 2024. p. S160. PD175.
Identificador
2024HTAi044
Title
Using machine learning to optimize systematic literature reviews
Description
Abstract presented at Health Technology Assessment international (HTAi)
Source
HTAi
Publication year
2024
Reference (Vancouver)
Chacko A. Using machine learning to optimize systematic literature reviews. In: HTAi Annual Meeting Abstract Book; 2024 Dec; Seville, Spain. Health Technology Assessment International, HTAi; 2024. p. S160. PD175.
Identifier
2024HTAi044
Resumo
Introdução: A triagem e seleção de publicações consomem muito tempo ao conduzir revisões sistemáticas de literatura. Atualmente, no campo da cirurgia assistida por robótica (RAS), há uma média de 12 a 15 estudos publicados diariamente, tornando o gerenciamento manual de dados insustentável. Nosso objetivo foi investigar como o aprendizado de máquina (ML) pode ser usado para otimizar os processos manuais de revisões de literatura. Métodos: Novas publicações RAS no PubMed, Scopus e Embase são rotineiramente rastreadas quanto à relevância e, em seguida, marcadas com metadados para auxiliar análises futuras. Uma biblioteca com curadoria de aproximadamente 40.000 publicações RAS marcadas serviu como nosso conjunto de dados de treinamento. Para dar suporte aos esforços manuais de triagem e marcação, vários modelos de ML foram comparados, incluindo regressão logística, árvores de decisão e aumento de gradiente. Todas as implementações de modelos vieram do pacote Python scikitlearn. A métrica de avaliação para este estudo foi a pontuação F1, e os campos de interesse marcados foram tipo de procedimento e abordagem cirúrgica. Os modelos foram treinados em resumos de publicações e comparados com uma pesquisa de palavra-chave de linha de base para medir mudanças no desempenho. Resultados: As descobertas demonstraram que os modelos de ML podem classificar metadados-chave com altos níveis de precisão. O modelo de árvore de decisão rotulou corretamente os cinco procedimentos mais comuns no conjunto de dados, com uma pontuação F1 média de aproximadamente 0,90. Este mesmo modelo previu a abordagem cirúrgica com uma pontuação F1 média de 0,84. É importante observar que diferentes modelos tiveram melhor desempenho em diferentes cenários. Para compensar essa variabilidade, todos os modelos foram alimentados em um classificador de empilhamento — um modelo de conjunto que usa a saída de outros modelos como dados de treinamento de entrada. Conclusões: É evidente que os modelos de ML podem reduzir a carga cognitiva dos bibliotecários clínicos e mudar seu papel de triagem manual de artigos para validação de previsões de ML. O trabalho futuro pode envolver a comparação do desempenho de modelos de ML tradicionais com modelos de linguagem ampla (LLMs) para melhorar ainda mais as pontuações F1 e reduzir os desequilíbrios de classe.
Notas
O registro foi originalmente publicado em inglês. A versão em português foi traduzida com o apoio de inteligência artificial.
Abstract
Introduction: Screening and selecting publications are very time consuming when conducting systematic literature reviews. Currently, in the field of robotic-assisted surgery (RAS) there is an average of 12 to 15 studies published daily, making manual data management unsustainable. We aimed to investigate how machine learning (ML) can be used to optimize the manual processes of literature reviews. Methods: New RAS publications in PubMed, Scopus, and Embase are routinely screened for relevancy and then tagged with metadata to aid future analysis. A curated library of approximately 40,000 tagged RAS publications served as our training dataset. To support manual screening and tagging efforts, multiple ML models were benchmarked, including logistic regression, decision trees, and gradient boosting. All model implementations came from the Python scikitlearn package. The evaluation metric for this study was the F1 score, and the fields of interest tagged were procedure type and surgical approach. Models were trained on publication abstracts and compared with a baseline keyword search to measure changes in performance. Results: The findings demonstrated that ML models can classify key metadata with high levels of accuracy. The decision tree model correctly labeled the five most common procedures in the dataset, with an average F1 score of approximately 0.90. This same model predicted surgical approach with an average F1 score of 0.84. It is important to note that different models performed best in different scenarios. To compensate for this variability, all models were fed into a stacking classifier—an ensemble model that takes the output of other models as input training data. Conclusions: It is evident that ML models can reduce the cognitive burden of clinical librarians and shift their role from hand-screening papers to validating ML predictions. Future work may involve comparing the performance of traditional ML models with large language models (LLMs) to further improve F1 scores and reduce class imbalances.
Notes
The record was originally published in English. The Portuguese version was translated with the support of artificial intelligence.