Hierarchical Semantic-Guided Attention with Prompt-Augmented Vision Prototypes for 3D Point Cloud Few-Shot Learning
摘要
Few-shot classification of 3D point clouds aims to classify data with limited training samples. Existing methods project point clouds into 2D depth images for leveraging mature 2D models, but large point spacing causes discontinuous and granular projections, leading to information loss. Additionally, hard samples induced by ambiguous visual features significantly degrade classification accuracy. To address these issues, we propose two key innovations: 1. Prompt-Augmented Projection (PAP): A module that adaptively optimizes geometric encoding and shading via prior knowledge from pretrained 2D models, enhancing textures and contours in projections. 2. Hierarchical Semantic-Guided Attention (HSEGA): A mechanism integrating tree-structured semantic hierarchy (e.g., WordNet) to resolve visual confusion by aligning coarse-to-fine semantics with visual prototypes. Experiments on ModelNet40-FS and ShapeNet55-FS show that our method achieves 75.33% accuracy in 5-way 1-shot tasks, surpassing baselines (SEGA-PP) by 3.56% with statistical significance (p < 0.01). This work provides a robust solution for 3D recognition in data-scarce scenarios like robotics and AR/VR.