Enhancing Multi-modal Object Detection with Data Augmentation, Focal Loss, and Model Ensembling
摘要
This article discusses our team’s success in securing first place in ICPR 2024 Multi-Modal Visual Pattern Recognition Challenge-Track 2 by applying data augmentation, focal loss, and model ensemble techniques. Data enhancement improves training data diversity, focal loss addresses class imbalance by focusing on challenging examples, and model ensembling combines predictions from multiple models for better performance. Together, these strategies lead to significant improvements in model accuracy and robustness, contributing to our high-ranking result. Code at https://github.com/chaoyuhao/ICPR24_competition.git .