Algoritmos de co-clustering baseados no kernel Gaussiano com cálculo automático dos hiperparâmetros de largura e dupla ponderação
Co-clustering. Kernel Gaussiano. Cálculo automático do hiperparâmetro de largura. Peso de variáveis. Peso de objetos.
Algoritmos de co-clustering particionam uma matriz de dados em blocos, agrupando simultaneamente objetos de acordo com variáveis e variáveis de acordo com objetos — uma estratégia que tem recebido atenção crescente nos últimos anos. Paralelamente, o agrupamento baseado em funções de kernel é uma área de pesquisa bem estabelecida, pois permite identificar grupos com formatos não hiperesféricos e/ou grupos com separação não linear por meio de transformações no espaço dos dados. No entanto, a integração entre co-clustering e métodos de kernel ainda está em estágio inicial. Este trabalho propõe duas novas famílias de algoritmos que combinam co-clustering com funções de kernel, em especial o kernel Gaussiano. Na primeira proposta, são introduzidos os primeiros algoritmos de co-clustering, nas abordagens hard e fuzzy, capazes de estimar automaticamente o hiperparâmetro de largura do kernel Gaussiano. A principal vantagem dos métodos propostos é a eliminação da necessidade de uma etapa prévia de ajuste desse hiperparâmetro. Além disso, os modelos permitem definições flexíveis para o parâmetro de largura: ele pode ser compartilhado entre todos os grupos, variando apenas com relação aos objetos ou variáveis (métodos globais), ou pode variar entre os grupos de objetos e variáveis (métodos locais). Como resultado, os métodos propostos podem reescalar objetos e variáveis separadamente, de acordo com sua distribuição ou, no caso local, de acordo com a distribuição dentro de cada grupo. A segunda proposta introduz modelos de co-clustering baseados no kernel Gaussiano com dupla ponderação, isto é, com pesos simultâneos para objetos e variáveis. Esses métodos também foram desenvolvidos nas abordagens fuzzy e hard, considerando tanto estruturas de pesos globais quanto locais. A principal vantagem desses métodos consiste em sua capacidade de mitigar os efeitos de ruídos presentes tanto nos objetos quanto nas variáveis. Além disso, também foram desenvolvidas variantes com ponderação unilateral, obtidas ao fixar os pesos em uma das dimensões. Experimentos conduzidos com dados sintéticos e reais demonstraram a eficácia dos métodos propostos neste trabalho. A grande maioria das variantes propostas apresentou desempenho superior ou competitivo em relação aos métodos do estado da arte, tanto de agrupamento tradicional quanto de co-clustering. Esses resultados foram corroborados por testes estatísticos.