Mejora en la calidad de los datos: Una perspectiva de las técnicas de preprocesado para la Minería de Datos

Identificadores
Statistics
Metadata
Show full item recordAlternative title
Enhancing data quality: A perspective on the preprocessing techniques for Data Mining
Author/s
Cabrera Sánchez, Juan Francisco
Date
2025-03-06Advisor
Silva Ramírez, Esther Lydia
Department
Ingeniería InformáticaAbstract
En la actualidad, el volumen de información que se transmite cada día crece conforme aumenta el número de dispositivos interconectados. En problemas de distinto ámbito como el Internet de las Cosas, la Visión Artificial o el \textit{Big Data}, la información se utiliza para la toma de decisiones, ya sea en el sector público o privado. Para ello, resulta imprescindible llevar a cabo un preprocesamiento previo de los datos que permita mejorar la calidad de los mismos. Así, se consigue alcanzar unos resultados consistentes, válidos y preparados para un uso posterior, de tal forma que las decisiones estén guiadas por los datos. En el preprocesado se contemplan diversas fases orientadas a la mejora de la calidad de los datos, como la detección y corrección de ruido, anomalías o presencia de datos perdidos. Además, también se contemplan transformaciones sobre los conjuntos de datos con el objetivo de proporcionarlos en un formato idóneo a los modelos de extracción del conocimiento.
La presente tesis doctoral se enfoca al estudio, mejora y propuesta de diferentes técnicas de preprocesamiento de datos, con el objetivo de obtener datos de calidad que permitan alcanzar una mayor precisión de los modelos en tareas de regresión y clasificación. La investigación se centra en dos líneas de trabajo. Por un lado, la resolución del problema de los datos perdidos, desde la generación sintética de la pérdida hasta su resolución mediante la aplicación de métodos de imputación de datos. Al mismo tiempo, se propone un ejemplo real que permite validar las hipótesis planteadas. Y, por otro lado, se aportan técnicas de reducción del tamaño del conjunto de entrenamiento que permiten optimizar otros aspectos, como el tiempo de cómputo, sin que ello conlleve un perjuicio en el rendimiento de los modelos de aprendizaje automático.
Ambas líneas de trabajo han sido avaladas por la publicación de artículos en revistas internacionales, así como en congresos nacionales e internacionales. De este modo, se consideran demostradas las hipótesis planteadas en la presente tesis doctoral basada en la mejora de la calidad de los datos que permita la aplicación de modelos de extracción de conocimiento con la certeza de obtener resultados óptimos que posibilite la toma de decisiones basada en datos. Nowadays, the volume of information transmitted each day continues to grow
as the number of interconnected devices increases. In various domains, such as
the Internet of Things, Computer Vision, and Big Data, this information is used to
guide decision-making processes in both the public and private sectors. To this
end, it is essential to carry out preliminary data preprocessing to enhance data
quality. By doing so, the resulting data become consistent, valid, and prepared
for subsequent use, thus enabling data-driven decisions. The preprocessing stage
involves multiple phases aimed at improving data quality, including the detection
and correction of noise, anomalies, or missing values. In addition, transformations
are performed on datasets to provide them in an appropriate format for knowledge
extraction models.
The present doctoral thesis focuses on studying, improving, and proposing
various data preprocessing techniques, with the objective of obtaining high-quality
data that facilitate increased accuracy of models in regression and classification
tasks. The research is centered on two main lines of inquiry. On the one hand,
it addresses the issue of missing data, ranging from the synthetic generation
of missing data to its resolution through the application of data imputation
methods, alongside a real-world example to validate the stated hypotheses. On
the other hand, it proposes techniques to reduce the size of the training set, thereby
optimizing other aspects such as computation time, without compromising the
performance of machine learning models.
Both lines of research have been validated through publications in international
journals, as well as presentations at national and international conferences. Thus,
the hypotheses posed in the present doctoral thesis—grounded in improving
data quality to enable the application of knowledge extraction models with
the assurance of optimal results that support data-driven decision-making—are
deemed to be substantiated.
Subjects
Inteligencia Arficial; Missing Data; Preprocesado; Generación sintéticaCollections
- Tesis [842]
- Tesis Ing. Inf. [36]





