<p>Visual content retrieval systems facilitate accurate and efficient identification of visually similar images within large-scale databases, serving as a critical component in applications spanning from intelligent monitoring systems to digital media management. While existing deep metric learning approaches predominantly concentrate on developing discriminative feature embeddings to capture visual semantics, they often fail to account for intrinsic uncertainties arising from input noise or inherent semantic ambiguities. This study introduces an Uncertainty-Aware Multi-Scale Feature Aggregation Network (UAMSFANet) that constructs comprehensive image representations through the integration of hierarchical semantic features and probabilistic uncertainty modeling, enabling more reliable similarity computation. The proposed architecture features an innovative Dual Harmonized Focus Attention Module (DHFAM) that establishes cross-dimensional interactions between local spatial patterns and global channel contexts, effectively enhancing discriminative features while suppressing irrelevant information. Extensive experimental validation on standard benchmarks, including CUB-200-2021 and Stanford Cars dataset, confirms the framework’s superior retrieval performance and the synergistic effects of its architectural components. Our project link can be found <a href="https://github.com/rinizuzg/UAMSFANet.git">here</a>.</p>

错误:搜索内容不能为空,请输入英文关键词
错误:关键词超出字数限制,请精简
高级检索

Multi-scale feature aggregation with hierarchical semantics and uncertainty assessment: enabling high-accuracy visual retrieval

  • JingWen Cui,
  • ChunHong Yuan,
  • Dan zhang

摘要

Visual content retrieval systems facilitate accurate and efficient identification of visually similar images within large-scale databases, serving as a critical component in applications spanning from intelligent monitoring systems to digital media management. While existing deep metric learning approaches predominantly concentrate on developing discriminative feature embeddings to capture visual semantics, they often fail to account for intrinsic uncertainties arising from input noise or inherent semantic ambiguities. This study introduces an Uncertainty-Aware Multi-Scale Feature Aggregation Network (UAMSFANet) that constructs comprehensive image representations through the integration of hierarchical semantic features and probabilistic uncertainty modeling, enabling more reliable similarity computation. The proposed architecture features an innovative Dual Harmonized Focus Attention Module (DHFAM) that establishes cross-dimensional interactions between local spatial patterns and global channel contexts, effectively enhancing discriminative features while suppressing irrelevant information. Extensive experimental validation on standard benchmarks, including CUB-200-2021 and Stanford Cars dataset, confirms the framework’s superior retrieval performance and the synergistic effects of its architectural components. Our project link can be found here.