A Comparative Evaluation of Probabilistic and Transformer-Based Topic Models Across Diverse and Multilingual Text Corpora
摘要
Topic modeling remains essential for uncovering latent structures in large text corpora, yet performance varies across languages, domains, and document lengths. This study compares five models—Latent Dirichlet Allocation (LDA), Collapsed Gibbs Sampling for LDA, LDA2Vec, Top2Vec, and BERTopic—across three datasets: Hausa news, English short texts (20 Newsgroups), and English long-form corpora (PubMed abstracts and legal case summaries). All models were trained using standardized preprocessing and coherence-based topic optimization under fully reproducible settings. Evaluation combined quantitative metrics (