Imputação automática de atributos faltantes em problemas de classificação: um estudo comparativo envolvendo algoritmos bio-inspirados

Pedro Gonçalves de Oliveira

Imputação automática de atributos faltantes em problemas de classificação: um estudo comparativo envolvendo algoritmos bio-inspirados [Digital]

Material

Dissertação

Idioma

Português

CDU e Cutter

681.3:004.8

Publicação

Fortaleza, 2009.

Resumo

Diversas bases de dados reais se caracterizam pela ausência marcante de determinados valores de seus atributos. Esses dados ausentes podem vir a degradar sobremaneira o desempenho de algoritmos de mineração de dados, dificultando a análise resultante. Uma maneira comum de tratar esse problema é via... Ver mais

Diversas bases de dados reais se caracterizam pela ausência marcante de determinados valores de seus atributos. Esses dados ausentes podem vir a degradar sobremaneira o desempenho de algoritmos de mineração de dados, dificultando a análise resultante. Uma maneira comum de tratar esse problema é via imputação, ou seja, estimação dos valores faltantes a partir de outros existentes na base. Este trabalho avalia como uma abordagem de imputação por otimização numérica utilizando algoritmos bio-inspirados pode vir a aprimorar o desempenho de classificadores induzidos sobre as bases pré-processadas. Três técnicas foram empregadas segundo esta abordagem: imputação utilizando algoritmo genético (GA), imputação utilizando otimização por enxame de partículas (PSO) e imputação utilizando co-evolução cooperativa. Com o intuito de analisar as técnicas propostas, em termos de eficiência e eficácia, seis bases de dados do repositório UCI e cinco populares algoritmos de classificação foram adotados. Para efeito de comparação, foram empregadas ainda outras duas técnicas tradicionais de imputação: a imputação pela média ou moda e a imputação fazendo uso do algoritmo KNN. O estudo mostra que todas as técnicas de imputação consideradas são capazes de elevar o desempenho dos classificadores. Os resultados obtidos não apontam para um método ótimo para todas as situações. Contudo, os experimentos sugerem que, em geral, as técnicas que fazem uso de algoritmos bio-inspirados são as mais eficazes ao passo que as técnicas tradicionais são as de melhor desempenho computacional. Observa-se também que os algoritmos co-evolução cooperativa e PSO, ainda não muito explorados no contexto de pré-processamento de dados, sobressaíram-se em diversos experimentos realizados.
Palavras-Chave: Mineração de dados, Pré-processamento de dados, Imputação de valores faltantes, Metaheurísticas, Algoritmos genéticos, Otimização por enxame de partículas, Co-evolução cooperativa.
Ver menos

Real-world databases may contain several missing values, which may degrade the performance of data mining algorithms running over them, making it hard to analyze data. This problem is usually dealt with missing value imputation. The present work evaluates how imputation by numerical optimization... Ver mais

Real-world databases may contain several missing values, which may degrade the performance of data mining algorithms running over them, making it hard to analyze data. This problem is usually dealt with missing value imputation. The present work evaluates how imputation by numerical optimization using bio-inspired algorithms may affect the performance of classifiers induced over pre-processed data. Here, three techniques were conceived: imputation using genetic algorithm (GA), imputation using particle swarm optimization (PSO), and imputation using cooperative co-evolution. In order to analyze the proposed techniques, six different datasets from the UCI Machine Learning Repository and five well known classification algorithms were adopted. In this analysis, efficiency and efficacy criteria were taken into account. In order to compare the results obtained, two traditional missing value imputation techniques were used, namely, imputation using mean or mode, and imputation using the KNN algorithm. The study shows that all the imputation techniques considered could increase the performance of the resulting classifiers. The obtained results do not point out an optimal method, adequate to all situations. The experiments, however, showed that, in general, the techniques that use bio-inspired algorithms were the most effective, while traditional techniques entailed better computational performance. It should also be observed that the heuristic techniques PSO and cooperative co-evolution, still not much explored in the context of data preprocessing, could have prevailed in several experiments.
Keywords: Data mining, Data preparation, Missing value imputation, Metaheuristics, Genetic algorithms, Particle swarm optimization, Cooperative co-evolution. Ver menos

Nota de forma física adicional

Disponibilidade forma física: Existe obra em CD-Rom de código : 82713

Disponibilidade forma física: Existe obra impressa de código : 82962

Assuntos

Mineração de dados

Algorítmos genéticos

Otimização matemática

Autoria

Oliveira, Pedro Gonçalves de Autor

Coelho, Andre Luis Vasconcelos Orientador

Coelho, Andre Luis Vasconcelos Banca examinadora

Carvalho, Andre Ponce de Leon Ferreira de Banca examinadora

Pinheiro, Plácido Rogério Banca examinadora

Universidade de Fortaleza. Programa de Pós-Graduação em Informática Aplicada Dissertação (mestrado)

URL

https://uol.unifor.br/auth-sophia/exibicao/5923

Imputação automática de atributos faltantes em problemas de classificação: um estudo comparativo envolvendo algoritmos bio-inspirados [Digital]

Terminal de consulta web

Imputação automática de atributos faltantes em problemas de classificação: um estudo comparativo envolvendo algoritmos bio-inspirados [Digital]

Imputação automática de atributos faltantes em problemas de classificação: um estudo comparativo envolvendo algoritmos bio-inspirados [Digital]

Imputação automática de atributos faltantes em problemas de classificação: um estudo comparativo envolvendo algoritmos bio-inspirados [Digital]