Banca de DEFESA: VITORIA DE ARAUJO XAVIER

Uma banca de DEFESA de MESTRADO foi cadastrada pelo programa.
DISCENTE: VITORIA DE ARAUJO XAVIER
DATA : 28/07/2026
HORA: 09:00
LOCAL: Virtual
TÍTULO:

Geração de Legendas de Imagens Radiológicas com Recuperação
Visual-Semântica Utilizando Modelos Fundacionais.

 


PALAVRAS-CHAVES:

Captioning Médico. Retrieval-Augmented Generation. RAG.
Modelos Fundacionais. Vision-Language Models. Large Language Models.

 


PÁGINAS: 126
RESUMO:

Este trabalho propõe e avalia um framework não paramétrico para captioning
médico em imagens radiológicas baseado em recuperação visual-semântica e síntese
multimodelo. A proposta combina indexação de embeddings visuais em uma base vetorial
FAISS, recuperação de captions semanticamente semelhantes, geração por modelos fundacionais e uma etapa de síntese das descrições produzidas por múltiplos modelos, sem necessidade de fine-tuning.
Além da avaliação da estratégia de recuperação, também foi investigado um módulo de fusão semântica de captions candidatas, funcionando como um ensemble em nível de saída, parasintetizar uma legenda final. Os experimentos foram conduzidos utilizando o conjunto dedados ROCOv2 e envolveram os modelos Gemini 2.5 Pro, GPT-4o, Claude 4.5 Sonnet e modelos da família LLaMA 4. O desempenho foi avaliado por meio de métricas automáticas lexicais e semânticas, incluindo BLEU, ROUGE, METEOR e BERTScore, complementadas por análises qualitativas e de custo computacional. Os resultados mostraram que a estratégia de recuperação visual-semântica produziu melhorias consistentes nessas métricas em comparação com a geração sem recuperação. Entre os modelos avaliados, o LLaMA 4 Maverick associado ao RAG apresentou o melhor equilíbrio entre desempenho nas métricas automáticas e custo de inferência. A estratégia de fusão de legendas proporcionou ganhos adicionais em parte das métricas avaliadas, embora com aumento significativo do custo computacional. Também foram investigadas modificações na etapa de recuperação, incluindo o uso de embeddings biomédicos (MedSigLIP), ampliação da base vetorial e refinamento do prompt. Os resultados indicaram que uma estratégia de recuperação mais especializada manteve desempenho semelhante ao da configuração original, enquanto o refinamento do prompt aumentou a variabilidade das legendas sem produzir ganhos consistentes nas métricas automáticas. De forma geral, os resultados indicam que estratégias não paramétricas baseadas em recuperação visual-semântica constituem uma alternativa promissora para adaptar modelos fundacionais multimodais ao domínio radiológico sem treinamento adicional.

 


MEMBROS DA BANCA:
Presidente - 1675582 - CLEBER ZANCHETTIN
Interno - 2320094 - LUCIANO DE ANDRADE BARBOSA
Externo à Instituição - LUIS FILIPE ALVES PEREIRA - UFAPE
Interno - 1511095 - TSANG ING REN
Notícia cadastrada em: 09/07/2026 11:58
SIGAA | Superintendência de Tecnologia da Informação (STI-UFPE) - (81) 2126-7777 | Copyright © 2006-2026 - UFRN - sigaa03.ufpe.br.sigaa03