<p>Real-time dance recognition is central to interactive training, immersive media, and digital choreography analytics, yet it remains difficult due to fine grained motion structure, heterogeneous wearable signals, and distribution shifts across dancers, styles, and capture setups. In practice, recognition systems must fuse multi-location IMUs and optional foot pressure cues while operating under strict latency constraints and maintaining reliability when modalities are missing or sensor conditions drift. This study addresses these challenges with FusionDanceNet, a multisensor fusion and domain regularized architecture that couples cross modal gated fusion with multi-scale temporal encoding and factorized spatio-temporal attention to capture both micro step dynamics and longer rhythmic phrases. To improve portability across datasets, FusionDanceNet integrates a domain regularized objective that reduces domain-specific nuisance variation while preserving dataset specific class discrimination. For deployable feedback, this study further provides sensor level attribution and quantifies explanation fidelity using a deletion-based metric. FusionDanceNet is evaluated on three domains, ImperialDance, CMU-MoCap (inertial), and AIST++ (inertial) using accuracy, Macro-F1, latency, robustness under tempo,&#xa0;drift, and node drop perturbations, and explanation fidelity (EF). FusionDanceNet achieves 96.6% accuracy and 94.2% Macro-F1 on ImperialDance with 8.3 ms latency, and maintains 95.2%&#xa0;and&#xa0;92.8% on CMU-MoCap and 95.0%&#xa0;and&#xa0;92.5% on AIST++ with comparable latency. Robustness remains stable at&#xa0;0.87&#xa0;to 0.88 and explanation fidelity&#xa0;(EF) consistently high at&#xa0;0.76&#xa0;to 0.78, supporting real-time, interpretable dance recognition under domain shift.</p>

错误:搜索内容不能为空,请输入英文关键词
错误:关键词超出字数限制,请精简
高级检索

FusionDanceNet for real time dance recognition using multisensor fusion and domain regularized learning

  • Jinying Han,
  • Ni Jin

摘要

Real-time dance recognition is central to interactive training, immersive media, and digital choreography analytics, yet it remains difficult due to fine grained motion structure, heterogeneous wearable signals, and distribution shifts across dancers, styles, and capture setups. In practice, recognition systems must fuse multi-location IMUs and optional foot pressure cues while operating under strict latency constraints and maintaining reliability when modalities are missing or sensor conditions drift. This study addresses these challenges with FusionDanceNet, a multisensor fusion and domain regularized architecture that couples cross modal gated fusion with multi-scale temporal encoding and factorized spatio-temporal attention to capture both micro step dynamics and longer rhythmic phrases. To improve portability across datasets, FusionDanceNet integrates a domain regularized objective that reduces domain-specific nuisance variation while preserving dataset specific class discrimination. For deployable feedback, this study further provides sensor level attribution and quantifies explanation fidelity using a deletion-based metric. FusionDanceNet is evaluated on three domains, ImperialDance, CMU-MoCap (inertial), and AIST++ (inertial) using accuracy, Macro-F1, latency, robustness under tempo, drift, and node drop perturbations, and explanation fidelity (EF). FusionDanceNet achieves 96.6% accuracy and 94.2% Macro-F1 on ImperialDance with 8.3 ms latency, and maintains 95.2% and 92.8% on CMU-MoCap and 95.0% and 92.5% on AIST++ with comparable latency. Robustness remains stable at 0.87 to 0.88 and explanation fidelity (EF) consistently high at 0.76 to 0.78, supporting real-time, interpretable dance recognition under domain shift.