• español
    • English
  • Login
  • español 
    • español
    • English

UniversidaddeCádiz

Área de Biblioteca, Archivo y Publicaciones
Comunidades y colecciones
Ver ítem 
  •   RODIN Principal
  • Producción Científica
  • Tesis
  • Ver ítem
  •   RODIN Principal
  • Producción Científica
  • Tesis
  • Ver ítem
JavaScript is disabled for your browser. Some features of this site may not work without it.

Mejora en la calidad de los datos: Una perspectiva de las técnicas de preprocesado para la Minería de Datos

Thumbnail
Identificadores

URI: http://hdl.handle.net/10498/36186

Ficheros
Documento de tesis doctoral (23.08Mb)
Estadísticas
Ver estadísticas
Compartir
Exportar a
Exportar a MendeleyRefworksEndNoteBibTexRIS
Metadatos
Mostrar el registro completo del ítem
Título alternativo
Enhancing data quality: A perspective on the preprocessing techniques for Data Mining
Autor/es
Cabrera Sánchez, Juan FranciscoAutoridad UCA
Fecha
2025-03-06
Director/Tutor
Silva Ramírez, Esther LydiaAutoridad UCA
Departamento/s
Ingeniería Informática
Resumen
En la actualidad, el volumen de información que se transmite cada día crece conforme aumenta el número de dispositivos interconectados. En problemas de distinto ámbito como el Internet de las Cosas, la Visión Artificial o el \textit{Big Data}, la información se utiliza para la toma de decisiones, ya sea en el sector público o privado. Para ello, resulta imprescindible llevar a cabo un preprocesamiento previo de los datos que permita mejorar la calidad de los mismos. Así, se consigue alcanzar unos resultados consistentes, válidos y preparados para un uso posterior, de tal forma que las decisiones estén guiadas por los datos. En el preprocesado se contemplan diversas fases orientadas a la mejora de la calidad de los datos, como la detección y corrección de ruido, anomalías o presencia de datos perdidos. Además, también se contemplan transformaciones sobre los conjuntos de datos con el objetivo de proporcionarlos en un formato idóneo a los modelos de extracción del conocimiento. La presente tesis doctoral se enfoca al estudio, mejora y propuesta de diferentes técnicas de preprocesamiento de datos, con el objetivo de obtener datos de calidad que permitan alcanzar una mayor precisión de los modelos en tareas de regresión y clasificación. La investigación se centra en dos líneas de trabajo. Por un lado, la resolución del problema de los datos perdidos, desde la generación sintética de la pérdida hasta su resolución mediante la aplicación de métodos de imputación de datos. Al mismo tiempo, se propone un ejemplo real que permite validar las hipótesis planteadas. Y, por otro lado, se aportan técnicas de reducción del tamaño del conjunto de entrenamiento que permiten optimizar otros aspectos, como el tiempo de cómputo, sin que ello conlleve un perjuicio en el rendimiento de los modelos de aprendizaje automático. Ambas líneas de trabajo han sido avaladas por la publicación de artículos en revistas internacionales, así como en congresos nacionales e internacionales. De este modo, se consideran demostradas las hipótesis planteadas en la presente tesis doctoral basada en la mejora de la calidad de los datos que permita la aplicación de modelos de extracción de conocimiento con la certeza de obtener resultados óptimos que posibilite la toma de decisiones basada en datos.
 
Nowadays, the volume of information transmitted each day continues to grow as the number of interconnected devices increases. In various domains, such as the Internet of Things, Computer Vision, and Big Data, this information is used to guide decision-making processes in both the public and private sectors. To this end, it is essential to carry out preliminary data preprocessing to enhance data quality. By doing so, the resulting data become consistent, valid, and prepared for subsequent use, thus enabling data-driven decisions. The preprocessing stage involves multiple phases aimed at improving data quality, including the detection and correction of noise, anomalies, or missing values. In addition, transformations are performed on datasets to provide them in an appropriate format for knowledge extraction models. The present doctoral thesis focuses on studying, improving, and proposing various data preprocessing techniques, with the objective of obtaining high-quality data that facilitate increased accuracy of models in regression and classification tasks. The research is centered on two main lines of inquiry. On the one hand, it addresses the issue of missing data, ranging from the synthetic generation of missing data to its resolution through the application of data imputation methods, alongside a real-world example to validate the stated hypotheses. On the other hand, it proposes techniques to reduce the size of the training set, thereby optimizing other aspects such as computation time, without compromising the performance of machine learning models. Both lines of research have been validated through publications in international journals, as well as presentations at national and international conferences. Thus, the hypotheses posed in the present doctoral thesis—grounded in improving data quality to enable the application of knowledge extraction models with the assurance of optimal results that support data-driven decision-making—are deemed to be substantiated.
 
Materias
Inteligencia Arficial; Missing Data; Preprocesado; Generación sintética
Colecciones
  • Tesis [842]
  • Tesis Ing. Inf. [36]
Attribution-NonCommercial-NoDerivatives 4.0 Internacional
Esta obra está bajo una Licencia Creative Commons Attribution-NonCommercial-NoDerivatives 4.0 Internacional

Listar

Todo RODINComunidades y ColeccionesPor fecha de publicaciónAutoresTítulosMateriasEsta colecciónPor fecha de publicaciónAutoresTítulosMaterias

Mi cuenta

AccederRegistro

Estadísticas

Ver Estadísticas de uso

Información adicional

Acerca de...Deposita en RODINPolíticasNormativasDerechos de autorEnlaces de interésEstadísticasNovedadesPreguntas frecuentes

RODIN está accesible a través de

OpenAIREOAIsterRecolectaHispanaEuropeanaBaseDARTOATDGoogle Académico

Enlaces de interés

Sherpa/RomeoDulcineaROAROpenDOARCreative CommonsORCID

RODIN está gestionado por el Área de Biblioteca, Archivo y Publicaciones de la Universidad de Cádiz

ContactoSugerenciasAtención al Usuario