Overfitting Risks and Solutions in Deep Learning for Railway Fault Diagnosis
摘要
Deep learning has demonstrated considerable potential for railway fault diagnosis, yet its vulnerability to overfitting poses significant risks to real-world deployment. This paper systematically addresses this challenge through three key contributions: (1) Identification of domain-specific causes of overfitting in rail systems, including extreme data scarcity (e.g., < 0.01% fault occurrence rates), coupled sensor noise (vibration/electromagnetic interference), and environmental covariate shifts (signal distribution drift induced by temperature/humidity variations); (2) Proposal of a Causal Information Bottleneck (CIB) framework integrating information bottleneck theory with causal graph learning, which compresses noise information flow through do-operator interventions; (3) Mathematical proof of 63% tighter generalization bounds versus standard CNNs. Via rigorous validation on three critical bearing fault types (outer race/inner race/roller element), CIB achieves 97.52% mean accuracy under small-sample conditions (≤ 50 samples/class), outperforming CNNs by 11.2%. This work establishes both theoretical foundations and engineering paradigms for developing EN 50126-compliant robust AI systems in rail transportation.