Detección y tipificación de vehículos de transporte mediante análisis de imágenes

Identificadores
Statistics
Metadata
Show full item recordAuthor/s
Durán Obregón, AlejandroDate
2026-07-21Abstract
La visión por computador aplicada al análisis de tráfico permite obtener información sobre la composición vehicular a partir de imágenes captadas por cámaras convencionales, evitando la necesidad de infraestructuras de sensorización específicas. En este trabajo se estudian distintos enfoques para la tipificación automática de vehículos de transporte mediante clasificación de imágenes. La propuesta se desarrolla sobre un entorno experimental común que incluye preparación de datos, extracción de características visuales, entrenamiento de modelos y evaluación de resultados. El benchmark principal se construye combinando muestras de los datasets públicos MIO-TCD y TRUDI. Cuando es necesario, las anotaciones de detección se transforman en recortes clasificables. Además, para reducir la fuga de información entre entrenamiento y prueba, el particionado se realiza mediante agrupaciones basadas en similitud visual. Sobre este entorno se comparan distintas estrategias de representación visual, incluyendo embeddings obtenidos con backbones preentrenados de visión y visión-lenguaje, especialmente CLIP y DINOv2. También se evalúan distintos clasificadores lineales y una CNN simple entrenada desde cero. La experimentación incluye tanto un escenario supervisado convencional como un bloque de self-learning orientado al aprovechamiento de datos no etiquetados obtenidos a partir de vídeo privado anonimizado. La evaluación se centra en métricas robustas frente al desbalance de clases, especialmente balanced accuracy, complementadas con macro-F1, métricas por clase y tiempos de ejecución. Los resultados muestran que las representaciones basadas en CLIP combinadas con clasificadores lineales ofrecen una relación rendimiento-coste favorable dentro de las configuraciones evaluadas. Por el contrario, la CNN simple entrenada desde cero obtiene resultados inferiores en las métricas principales y requiere un mayor coste de entrenamiento. Además, el trabajo incorpora un flujo complementario de detección, seguimiento y anonimización sobre vídeo privado para obtener datos no etiquetados próximos al entorno de aplicación, sin incorporarlos al conjunto de prueba principal. Sobre estos datos se analizan distintas variantes de self-learning. En los experimentos realizados, las estrategias conservadoras basadas en umbrales de confianza o cupos por clase muestran un comportamiento más estable que un enfoque agresivo de pseudoetiquetado, aunque sin desplazar la referencia supervisada del protocolo correspondiente.






