Enhanced Featurization of Queries with Interval Density Encoding
摘要
Learning-based cardinality estimation methods outperform traditional methods by effectively overcoming strong assumptions(attribute value independence and uniform distribution). Existing learning-based methods primarily rely on One-hot encoding for representing Structured Query Language(SQL) queries, which fails to capture semantic information like attribute value distribution. To solve this problem, we propose a new query featurization method called Interval Density Encoding(IDE). By encoding attribute value distribution information, IDE maintain the semantic information of SQL queries. Experimental results demonstrate that integrating IDE into existing learning-based cardinality methods significantly reduces the error of the learning-based model.