Variable Selection using Machine Learning Algorithms for Semiparametric Models
seleção de variáveis; modelos semiparamétricos; regressão distribucional; gradient boosting; GAMLSS; GBDTLSS; DeepGBMLSS.
Esta tese propõe e avalia um framework para seleção de variáveis em modelos aditivos semiparamétricos, especificamente os Modelos Aditivos Generalizados para Locação, Escala e Forma (GAMLSS), utilizando algoritmos de aprendizado de máquina, com intuito de aumentar a performance de modelos de regressão. A estrutura GAMLSS permite que todos os parâmetros da distribuição da variável resposta sejam modelados a partir de funções das variáveis explicativas, que permite heterocedasticidade, assimetria e curtose, por exemplo, características frequentemente encontradas em dados reais. Apesar da flexibilidade, métodos de machine learning vêm sendo incorporados ao GAMLSS com o objetivo de selecionar variáveis importantes automaticamente e simultaneamente a medida que os dados ficam mais complexos. A partir disso, são propostas duas estruturas: GBDTLSS e DeepGBMLSS, em que ambas estendem o GAMLSS integrando a estrutura do GBM com o intuito de selecionar variáveis automaticamente e simultaneamente para cada parâmetro distribucional, à medida que a complexidade dos dados aumenta. O GBDTLSS substitui o estimador interno do GAMLSS por um modelo GBDT, permitindo seleção de variáveis separada por parâmetro e suportando atualizações in- crementais online. O DeepGBMLSS estende essa proposta ao integrar a arquitetura DeepGBM à estrutura do GAMLSS, incorporando adicionalmente componentes de redes neurais capazes de representar variáveis categóricas esparsas de forma mais eficiente. Adicionalmente, uma análise bibliométrica que combina cienciometria e revisão sistemática seguindo o protocolo PRISMA foi conduzida, mapeando tendências de publicação em seleção de variáveis em modelos semiparamétricos e de regressão distribucional e identificando abordagens baseadas em ensemble como a classe de métodos de seleção de variáveis de maior crescimento nos últimos anos. A implementação original do DeepGBM foi refatorada em um pacote Python modular (DeepGBMbel), validado no dataset Zillow Prize contra LightGBM, XGBoost e CatBoost sob as mesmas condições experimentais descritas no artigo original. A validação experimental do GBDTLSS e do DeepGBMLSS em dados simulados e reais está prevista como os próximos passos desta pesquisa.