Channel-Dedicated Convolution Method Paired with Vision Transformers for Advanced Pneumonia Classification in X-Rays
摘要
An innovative hybrid deep learning model is introduced, combining channel-dedicated convolution techniques with Vision Transformers to enhance pneumonia classification in X-ray images. In rigorous preprocessing methods, such as histogram equalization, Sobel edge detection, and bilateral filtering, the model improves the visibility of pulmonary structures, which is crucial for accurate diagnosis. The architecture features independent channel processing and a multi-head attention mechanism, leading to superior performance in detecting and classifying various pneumonia types, including COVID-19. Comparative analysis shows that our model surpasses existing CNN and ViT models in precision, recall, and overall accuracy, achieving an impressive 91.42%. This research confirms the potential of integrating convolutional and transformer-based approaches to advance medical diagnostic capabilities.