This PRISMA-compliant systematic review synthesizes 127 studies (2018–2023) on emotion extraction from speech, focusing on machine learning (ML) and deep learning (DL) advancements. We analyze traditional methods (SVMs, HMMs), DL architectures (CNNs, transformers), and emerging trends (self-supervised learning, multimodal fusion). Our methodology includes rigorous quality assessment, meta-analysis, and bias evaluation. Results reveal DL models achieve 85% accuracy on IEMOCAP, surpassing ML’s plateau at 68%, but critical gaps persist in cultural bias, reproducibility, and ethics. We propose standardized benchmarks and ethical frameworks for future research. This review serves as a comprehensive guide for researchers and practitioners in affective computing.

错误:搜索内容不能为空,请输入英文关键词
错误:关键词超出字数限制,请精简
高级检索

Advancements and Challenges in Emotion Extraction from Speech: A PRISMA-Guided Systematic Review of Machine and Deep Learning Technique

  • Suryakant Tyagi,
  • Sándor Szénási

摘要

This PRISMA-compliant systematic review synthesizes 127 studies (2018–2023) on emotion extraction from speech, focusing on machine learning (ML) and deep learning (DL) advancements. We analyze traditional methods (SVMs, HMMs), DL architectures (CNNs, transformers), and emerging trends (self-supervised learning, multimodal fusion). Our methodology includes rigorous quality assessment, meta-analysis, and bias evaluation. Results reveal DL models achieve 85% accuracy on IEMOCAP, surpassing ML’s plateau at 68%, but critical gaps persist in cultural bias, reproducibility, and ethics. We propose standardized benchmarks and ethical frameworks for future research. This review serves as a comprehensive guide for researchers and practitioners in affective computing.