Standard-Prozessmodell
摘要
Endlich ist es soweit. Anna und Karl erstellen die ersten Prognosen. Sie klassifizieren 418 Titanic-Passagiere der Testdaten. Diese Prognosen laden sie auf die Data-Science-Plattform Kaggle hoch. Als Feedback liefert Kaggle die Treffergenauigkeit und die Platzierung in einer Rangliste zurück. Die ersten Modelle erzielen zwar noch keine sehr guten Ergebnisse, trotzdem ist dieser Schritt ein wichtiger Meilenstein für die beiden Trainees. Die Ergebnisse sind nicht zufällig zustande gekommen. Anna und Karl lernen, strukturiert und systematisch vorzugehen. Sie orientieren sich an CRISP-DM: Cross Industry Standard Process for Data Mining. Das ist das Referenz-Prozessmodell im Bereich Data Science. Es besteht aus sechs Phasen. Zwei der Phasen sind sie bereits gegangen, ohne es zu wissen: Geschäftsverständnis (Business Understanding) und Datenverständnis (Data Understanding). Nun gehen sie den Rest des Weges: Datenvorbereitung (Data Preparation), Modellierung (Modeling) Auswertung (Evaluation) und Einsatz der Ergebnisse (Deployment). Max und Sophia stehen ihnen dabei wieder zur Seite.