DESENVOLVIMENTO DE UM MODELO DE AUXILIO A TOMADA DE DECISÃO BASEADO EM APRENDIZADO POR REFORÇO MULTIAGENTE UTILIZANDO DADOS CLASSIFICADOS E DE PREVISÃO COM MODELAGEM DE ESTADOS PARA GERENCIAMENTO DE MANUTENÇÃO PREDITIVA EM PARQUES EÓLICOS
Aprendizado por Reforço Multiagente. Manutenção Preditiva. Energia Eólica. Processos de Decisão de Markov. Calibração Empírica de Dados SCADA.
A operação e manutenção (O&M) constitui o principal gargalo econômico do ciclo de vida de parques eólicos onshore, respondendo por até um quarto do custo nivelado de energia (LCOE). Apesar da maturidade dos sistemas de monitoramento de condição (SCADA e CMS), persiste uma lacuna decisória fundamental: a transição entre a detecção diagnóstica de anomalias e a prescrição de intervenções sob incerteza estocástica, restrição logística e volatilidade meteorológica. O objetivo primário desta tese é solucionar esse hiato operacional por meio da formulação do problema de manutenção preditiva de frotas eólicas como um Processo de Decisão de Markov Parcialmente Observável Descentralizado (Dec-POMDP) cooperativo, resolvido através de Aprendizado por Reforço Multiagente (MARL). A metodologia aplicada consistiu na modelagem de cada turbina como um agente autônomo operando sob o paradigma de Treinamento Centralizado com Execução Descentralizada (CTDE). O ambiente de simulação foi rigorosamente calibrado de forma empírica utilizando um histórico real de falhas e alarmes provenientes de uma frota instalada no Nordeste do Brasil. A política autônoma foi treinada utilizando o algoritmo Multi-Agent Proximal Policy Optimization (MAPPO), incorporando um esquema de aprendizado curricular baseado em densidade de degradação episódica. O protocolo de avaliação submeteu o modelo a três regimes de variabilidade e incerteza crescente (replay histórico, embaralhamento de janelas históricas e divergência estocástica permanente), comparando-o de maneira direta contra heurísticas operacionais, referencial de programação linear inteira mista (MILP) e a trajetória empírica estabelecida pelo operador humano. Os resultados demonstraram que o MAPPO atingiu um desempenho técnico equivalente aos limites analíticos de otimização em cenários amplamente determinísticos (alcançando 98,66% de disponibilidade média). Entretanto, sob os regimes de alta divergência estocástica, a política multiagente desenvolvida superou as demais alternativas centralizadas e abordagens heurísticas, maximizando o lucro líquido acumulado e reduzindo drasticamente a perda energética total dentro das condições de contorno do experimento construído. Esse desempenho econômico superior sustentou-se por um comportamento altamente proativo, registrando uma notável taxa de manutenção preventiva de até 94,65%, contendo a conversão de falhas incipientes em quebras funcionais diretas para apenas 5,35%, e demonstrando um aumento consistente na eficiência de agrupamento logístico. Conclui-se que o emprego do MAPPO viabiliza de fato estratégias autônomas, robustas e dinâmicas, assegurando de modo confiável o retorno financeiro e a eficiência da matriz energética eólica contemporânea.