Datenvorbereitung
摘要
Feature Engineering ist ein besonderer Schritt in der Phase 3 (Data Preparation) von CRISP-DM. Mit Hilfe dieser Methode erzeugen Anna und Karl neue Attribute, bspw. Title, FamilySize und LogFare. Diese neuen Attribute sollen zukünftig zu besseren Modellergebnissen führen. Die beiden Trainees lernen die Techniken One Hot Encoding und Binning sowie einige Skalierungen und Transformationen kennen. Dabei stoßen sie auf Herausforderungen wie den Fluch der Dimensionalität, Overfitting und Rauschen. Sie erkennen Gemeinsamkeiten und Unterschiede zwischen Klassifikation und Clusteranalyse. Schließlich erstellen Anna und Karl mit ihren Werkzeugen drei neue Sets von Trainings-, Test- und Anwendungsdaten. Die verschiedenen Datenvarianten unterscheiden sich hinsichtlich der Skalenniveaus und Datentypen der Attribute. Damit legen sie den Grundstein für den nächsten Teil ihres Data Science Trainings. Das Team, inklusive Max und Sophia, ist schon gespannt, wie k-Nearest Neighbor und weitere Klassifikationsmethoden abschneiden, wenn sie mit diesen vermeintlich verbesserten Daten arbeiten.