Advancing Multilingual Sentiment Understanding with XGBoost, SVM, and XLM-RoBERTa
摘要
In this comprehensive research, we explore multilingual sentiment analysis, aiming to classify sentiments as positive, negative, or neutral across languages. Our dataset includes 192,839 examples in English, Japanese, German, French, Spanish, Chinese, Indonesian, and Hindi. We assess three models: XGBoost (62% accuracy), SVM (64.2% accuracy), and the multilingual XLM-RoBERTa-base, which excels with an impressive 78.37% accuracy. XLM-RoBERTa-base’s adaptability to diverse languages makes it a crucial asset in multilingual sentiment analysis.