错误:搜索内容不能为空,请输入英文关键词
错误:关键词超出字数限制,请精简
高级检索

Standard-Prozessmodell

  • Stefan Selle

摘要

Endlich ist es soweit. Anna und Karl erstellen die ersten Prognosen. Sie klassifizieren 418 Titanic-Passagiere der Testdaten. Diese Prognosen laden sie auf die Data-Science-Plattform Kaggle hoch. Als Feedback liefert Kaggle die Treffergenauigkeit und die Platzierung in einer Rangliste zurück. Die ersten Modelle erzielen zwar noch keine sehr guten Ergebnisse, trotzdem ist dieser Schritt ein wichtiger Meilenstein für die beiden Trainees. Die Ergebnisse sind nicht zufällig zustande gekommen. Anna und Karl lernen, strukturiert und systematisch vorzugehen. Sie orientieren sich an CRISP-DM: Cross Industry Standard Process for Data Mining. Das ist das Referenz-Prozessmodell im Bereich Data Science. Es besteht aus sechs Phasen. Zwei der Phasen sind sie bereits gegangen, ohne es zu wissen: Geschäftsverständnis (Business Understanding) und Datenverständnis (Data Understanding). Nun gehen sie den Rest des Weges: Datenvorbereitung (Data Preparation), Modellierung (Modeling) Auswertung (Evaluation) und Einsatz der Ergebnisse (Deployment). Max und Sophia stehen ihnen dabei wieder zur Seite.