Grundbegriffe des Bestärkenden Lernens
摘要
Reinforcement Learning soll zweckmäßige und effiziente Agenten-Steuerungen automatisch generieren. In diesem Kapitel wird beschrieben, was ein Softwareagent ist und wie er mithilfe seiner Steuerung (engl. policy) in einer Umgebung mehr oder weniger intelligentes Verhalten erzeugt. Der Aufbau des Grundmodells des Verstärkenden Lernens wird beschrieben und der Intelligenzbegriff im Sinne einer behavioristischen Nutzenmaximierung vorgestellt. Außerdem werden einige formale Mittel eingeführt. Es wird dargestellt, wie mithilfe der Bellmanschen Gleichung voneinander abhängige Zustände bewertet werden und welche Rolle die „optimale Taktik“ dabei spielt.