• español
    • English
  • Login
  • English 
    • español
    • English

UniversidaddeCádiz

Área de Biblioteca, Archivo y Publicaciones
Communities and Collections
View Item 
  •   RODIN Home
  • Producción Científica
  • Tesis
  • View Item
  •   RODIN Home
  • Producción Científica
  • Tesis
  • View Item
JavaScript is disabled for your browser. Some features of this site may not work without it.

Mejora en la calidad de los datos: Una perspectiva de las técnicas de preprocesado para la Minería de Datos

Thumbnail
Identificadores

URI: http://hdl.handle.net/10498/36186

Files
Documento de tesis doctoral (23.08Mb)
Statistics
View statistics
Share
Export
Export reference to MendeleyRefworksEndNoteBibTexRIS
Metadata
Show full item record
Alternative title
Enhancing data quality: A perspective on the preprocessing techniques for Data Mining
Author/s
Cabrera Sánchez, Juan FranciscoAuthority UCA
Date
2025-03-06
Advisor
Silva Ramírez, Esther LydiaAuthority UCA
Department
Ingeniería Informática
Abstract
En la actualidad, el volumen de información que se transmite cada día crece conforme aumenta el número de dispositivos interconectados. En problemas de distinto ámbito como el Internet de las Cosas, la Visión Artificial o el \textit{Big Data}, la información se utiliza para la toma de decisiones, ya sea en el sector público o privado. Para ello, resulta imprescindible llevar a cabo un preprocesamiento previo de los datos que permita mejorar la calidad de los mismos. Así, se consigue alcanzar unos resultados consistentes, válidos y preparados para un uso posterior, de tal forma que las decisiones estén guiadas por los datos. En el preprocesado se contemplan diversas fases orientadas a la mejora de la calidad de los datos, como la detección y corrección de ruido, anomalías o presencia de datos perdidos. Además, también se contemplan transformaciones sobre los conjuntos de datos con el objetivo de proporcionarlos en un formato idóneo a los modelos de extracción del conocimiento. La presente tesis doctoral se enfoca al estudio, mejora y propuesta de diferentes técnicas de preprocesamiento de datos, con el objetivo de obtener datos de calidad que permitan alcanzar una mayor precisión de los modelos en tareas de regresión y clasificación. La investigación se centra en dos líneas de trabajo. Por un lado, la resolución del problema de los datos perdidos, desde la generación sintética de la pérdida hasta su resolución mediante la aplicación de métodos de imputación de datos. Al mismo tiempo, se propone un ejemplo real que permite validar las hipótesis planteadas. Y, por otro lado, se aportan técnicas de reducción del tamaño del conjunto de entrenamiento que permiten optimizar otros aspectos, como el tiempo de cómputo, sin que ello conlleve un perjuicio en el rendimiento de los modelos de aprendizaje automático. Ambas líneas de trabajo han sido avaladas por la publicación de artículos en revistas internacionales, así como en congresos nacionales e internacionales. De este modo, se consideran demostradas las hipótesis planteadas en la presente tesis doctoral basada en la mejora de la calidad de los datos que permita la aplicación de modelos de extracción de conocimiento con la certeza de obtener resultados óptimos que posibilite la toma de decisiones basada en datos.
 
Nowadays, the volume of information transmitted each day continues to grow as the number of interconnected devices increases. In various domains, such as the Internet of Things, Computer Vision, and Big Data, this information is used to guide decision-making processes in both the public and private sectors. To this end, it is essential to carry out preliminary data preprocessing to enhance data quality. By doing so, the resulting data become consistent, valid, and prepared for subsequent use, thus enabling data-driven decisions. The preprocessing stage involves multiple phases aimed at improving data quality, including the detection and correction of noise, anomalies, or missing values. In addition, transformations are performed on datasets to provide them in an appropriate format for knowledge extraction models. The present doctoral thesis focuses on studying, improving, and proposing various data preprocessing techniques, with the objective of obtaining high-quality data that facilitate increased accuracy of models in regression and classification tasks. The research is centered on two main lines of inquiry. On the one hand, it addresses the issue of missing data, ranging from the synthetic generation of missing data to its resolution through the application of data imputation methods, alongside a real-world example to validate the stated hypotheses. On the other hand, it proposes techniques to reduce the size of the training set, thereby optimizing other aspects such as computation time, without compromising the performance of machine learning models. Both lines of research have been validated through publications in international journals, as well as presentations at national and international conferences. Thus, the hypotheses posed in the present doctoral thesis—grounded in improving data quality to enable the application of knowledge extraction models with the assurance of optimal results that support data-driven decision-making—are deemed to be substantiated.
 
Subjects
Inteligencia Arficial; Missing Data; Preprocesado; Generación sintética
Collections
  • Tesis [842]
  • Tesis Ing. Inf. [36]
Attribution-NonCommercial-NoDerivatives 4.0 Internacional
This work is under a Creative Commons License Attribution-NonCommercial-NoDerivatives 4.0 Internacional

Browse

All of RODINCommunities and CollectionsBy Issue DateAuthorsTitlesSubjectsThis CollectionBy Issue DateAuthorsTitlesSubjects

My Account

LoginRegister

Statistics

View Usage Statistics

Información adicional

AboutDeposit in RODINPoliciesGuidelinesRightsLinksStatisticsNewsFrequently Asked Questions

RODIN is available through

OpenAIREOAIsterRecolectaHispanaEuropeanaBaseDARTOATDGoogle Academic

Related links

Sherpa/RomeoDulcineaROAROpenDOARCreative CommonsORCID

RODIN está gestionado por el Área de Biblioteca, Archivo y Publicaciones de la Universidad de Cádiz

Contact informationSuggestionsUser Support