Grundidee des Machine Learnings
摘要
Die Grundidee von ML ist die Entwicklung von Vorhersagemodellen aus Daten. Dieser Prozess umfasst im Wesentlichen drei Hauptkomponenten: (1) Repräsentation, das Set möglicher Modellfunktionen, (2) Evaluation, die Quantifizierung des Modellfehlers durch eine Verlustfunktion, und (3) Optimierung, die iterative Anpassung der Modellparameter. Ziel ist die Minimierung des empirischen Fehlers. Dabei gilt es, eine adäquate Modellflexibilität zu finden, um sowohl Overfitting als auch Underfitting zu vermeiden. Hierfür wird sogenanntes Resampling verwendet, um Modelle zu optimieren, indem Datensätze in Trainings- und Testsets aufgeteilt werden. Eine häufige Form des Resamplings ist die Kreuzvalidierung, bei der die Daten in Substichproben unterteilt werden und jede dieser einmal als Testset verwendet wird. Dadurch wird die Datennutzung maximiert und die Fehlerabschätzung verlässlicher. Nested Resampling, eine erweiterte Version des klassischen Resamplings, wird zudem genutzt, um Hyperparameter zu verbessern und eine unvoreingenommene Bewertung des Modells zu gewährleisten.