Definition
Formales Modell für sequentielle Entscheidungsprobleme, bei dem ein Agent einen Zustand aus einem Zustandsraum beobachtet, eine Aktion aus einer Aktionsmenge wählt und das System gemäß Übergangswahrscheinlichkeiten, die nur vom aktuellen Zustand und der Aktion abhängen (Markov‑Eigenschaft), in einen Folgezustand übergeht; eine Belohnungsfunktion weist unmittelbare Auszahlungen zu, und das Ziel ist die Maximierung des erwarteten kumulativen Ertrags über einen Horizont (diskontiert oder endlich).
Prinzip
Prinzip
Optimale Steuerung ist durch Bellman‑Optimalität gekennzeichnet: Die Wertfunktion erfüllt eine rekursive Gleichung, die den Wert eines Zustands mit der besten erwarteten unmittelbaren Belohnung plus dem diskontierten Wert der Folgezustände gleichsetzt; die Lösung dieser Gleichungen (Value‑Iteration, Policy‑Iteration, lineare Programmierung) liefert eine optimale Politik, wenn Zustands‑/Aktionsräume und Modellwahrscheinlichkeiten bekannt und rechnerisch handhabbar sind.
Demonstration
Demonstration
Illustratives Beispiel — Inventarsteuerung: Situation — Zustand = Lagerbestand, Aktion = Bestellmenge, Nachfrage stochastisch mit bekannter Verteilung. Erkennung — Übergangswahrscheinlichkeiten P(s'|s,a) aus dem Nachfragemodell und unmittelbare Kosten/Erträge (Lager, Fehlbestand, Bestellkosten) definieren. Aktion — Value‑Iteration durchführen: Initialisierung, Bellman‑Update iterieren bis Konvergenz, daraus Politik ableiten. Konsequenz — die gewonnene Politik minimiert die erwarteten Langzeitkosten unter dem angenommenen Modell und Diskontierung, vorbehaltlich Modelltreue und Rechenbeschränkungen.
Fehlanwendung
Fehlanwendung
Ein teilweise beobachtbares oder geschichtsabhängiges Problem als MDP zu modellieren, ohne den Zustand so zu erweitern, dass alle relevanten Informationen erfasst werden, oder eine gelernte Politik als optimal zu betrachten, obwohl Übergangswahrscheinlichkeiten oder Belohnungsfunktionen falsch spezifiziert sind; der semantische Fehler besteht darin, die Markov‑Eigenschaft oder Modellkenntnis dort anzunehmen, wo sie nicht gilt.
Konsequenz
Konsequenz
Richtig angewandt liefert ein MDP vorschreibende optimale Politiken und Wertgrenzen und unterstützt algorithmische Lösungsverfahren; Fehlanwendung führt zu schlechter oder unsicherer Systemperformance in Betrieb, weil unmodellierte Abhängigkeiten oder Modellunsicherheit die Optimalitätszusagen untergraben.
Umkehrung
Umkehrung
Ist der Agent nicht vollständig beobachtbar, handelt es sich um ein POMDP und die Zustandsdarstellung muss zu einem Glaubenszustand erweitert werden; sind Übergangswahrscheinlichkeiten oder Belohnungen unbekannt, sind Reinforcement Learning oder robuste MDP‑Formulierungen erforderlich; fortlaufende oder sehr große Zustands‑/Aktionsräume erfordern Funktionsapproximation, hierarchische Zerlegung oder approximative Algorithmen und verzichten auf exakte Bellman‑Lösungen.
Abgrenzung
Abgrenzung
Eindeutig innerhalb — endliche, diskrete Zustands‑/Aktionsprobleme mit bekannten Übergangswahrscheinlichkeiten und Belohnungen, die sich durch dynamische Programmierung lösen lassen. Grenzfall — sehr große oder kontinuierliche Zustands‑/Aktionsräume, wo exakte DP unpraktikabel ist und Approximation nötig wird. Eindeutig außerhalb — adversariale Einstellungen ohne stochastisches Übergangsmodell (spieltheoretische Formulierungen) oder Einmalentscheidungen ohne sequentielle Struktur.
Semantische Spannung
Semantische Spannung
Spannung zwischen Modelltreue und rechnerischer Machbarkeit: Eine vollständige Zustandsdarstellung stellt Markovität sicher, erhöht aber Dimensionalität und Rechenaufwand; Zustandssimplifikation macht Berechnung möglich, verletzt aber Markovannahmen und verschlechtert Politiken.
Synthese
Synthese
MDPs strukturieren sequentielle stochastische Entscheidungsfindung und identifizieren die Bellman‑Rekursion als zentrales Rechenprinzip; ihr praktischer Wert hängt davon ab, ob relevante Informationen in den Zustand gebracht werden können und ob Übergangs‑/Belohnungsmodelle innerhalb vorhandener Rechenressourcen bekannt oder erlernbar sind.