M3DNet: A Camera-Radar Fusion 3D Detection Algorithm with Dynamic Multi-scale Fusion and Radar Enhancement for Adverse Mining Scenarios
摘要
Perception systems for autonomous driving in complex industrial environments, such as open-pit mines, face severe challenges from dust occlusion, extreme illumination, and vast object scale variations, which significantly degrade the performance of conventional vision-only and fusion-based methods. To address these issues, this paper introduces M3DNet, an end-to-end Camera-Radar fusion framework for 3D object detection tailored for mining scenarios. The core of M3DNet is a comprehensive reliability-enhanced fusion paradigm, featuring three key innovations: (1) a mining-oriented radar feature enhancement module that mitigates point sparsity and ambiguity through noise filtering, elevation recovery, and semantic-guided diffusion; (2) a dynamic hierarchical multi-scale fusion architecture with a novel Dynamic Reliability-Aware Gating (DRAG) mechanism that adaptively weights modal contributions based on environmental conditions like dust; and (3) a mining-tailored multi-task loss function to target critical detection challenges. Extensive experiments on a real-world mining dataset demonstrate that M3DNet significantly outperforms state-of-the-art methods across all metrics, providing a high-performance, robust 3D perception solution for autonomous systems in harsh environments.