A new supervised outlier detection method for hybrid data
摘要
Outlier detection is an important research topic in data mining. The hybrid data contains numerical features, categorical features and missing information values at the same time, providing a variety of attribute descriptions, which can adapt to more practical application scenarios. However, the existing methods for outlier detection based on rough set theory rely predominantly on unlabeled data, and there are few studies focusing on hybrid data. This article investigates a supervised outlier detection for hybrid data based on conditional information entropy. First, the distance between information values in a hybrid information system (HIS) is introduced, and a variable parameter