Definición
Modelo formal para problemas de decisión secuencial en los que un agente observa un estado, elige una acción y el sistema transita a un siguiente estado según probabilidades de transición que dependen únicamente del estado y la acción presentes (propiedad de Markov); una función de recompensa asigna pagos inmediatos y el objetivo es maximizar la recompensa acumulada esperada en un horizonte (descontado o finito).

Principio

Principio
El control óptimo se caracteriza por la optimalidad de Bellman: la función de valor satisface una ecuación recursiva que iguala el valor de un estado a la mejor recompensa inmediata esperada más el valor descontado de los estados sucesores; resolver esas ecuaciones (value iteration, policy iteration, programación lineal) proporciona una política óptima cuando los espacios y probabilidades son conocidos y tratables.

Demostración

Demostración
Escenario ilustrativo — Gestión de inventario: Situación — estado = nivel de inventario, acción = cantidad a pedir, la demanda es estocástica con distribución conocida. Reconocimiento — definir P(s'|s,a) a partir del modelo de demanda y el coste/recompensa inmediata (almacenamiento, rotura, pedido). Acción — aplicar value iteration: inicializar, iterar la actualización de Bellman hasta convergencia y extraer la política que asocia a cada estado la acción óptima. Consecuencia — la política resultante minimiza el coste esperado a largo plazo bajo el modelo y la tasa de descuento supuestos, sujeto a la exactitud del modelo y límites computacionales.

Aplicación incorrecta

Aplicación incorrecta
Modelar un problema parcialmente observable o dependiente del historial como un MDP sin ampliar el estado para capturar la información requerida, o considerar una política aprendida como óptima cuando las probabilidades de transición o recompensas están mal especificadas; el error semántico es asumir la propiedad de Markov o el conocimiento del modelo donde no existen.

Consecuencia

Consecuencia
Si está bien especificado, un MDP proporciona políticas prescriptivas óptimas y cotas de valor, y admite técnicas algorítmicas de solución; mal aplicado, genera políticas de bajo rendimiento o inseguras en despliegue porque dependencias no modeladas o incertidumbre del modelo invalidan la optimalidad.

Inversión

Inversión
Si el agente no observa completamente el estado, el problema es un POMDP y exige la expansión del estado a una creencia; si las probabilidades de transición o recompensas son desconocidas, se requieren aprendizaje por refuerzo o formulaciones robustas; espacios continuos o muy grandes demandan aproximación por funciones, descomposición jerárquica o algoritmos aproximados que renuncian a la solución exacta de Bellman.

Límite

Límite
Dentro claramente — problemas discretos con estados/acciones finitos y probabilidades de transición y recompensas conocidas que permiten programación dinámica. Caso límite — espacios grandes o continuos donde la DP exacta es inviable y precisa aproximación. Fuera claramente — entornos adversarios sin modelo estocástico de transición (formulaciones de teoría de juegos) o decisiones puntuales sin estructura secuencial.

Tensión semántica

Tensión semántica
Tensión entre fidelidad del modelo y viabilidad computacional: representar toda la información pertinente en el estado asegura Markovidad pero aumenta dimensionalidad y coste; simplificar el estado hace factible el cálculo pero viola supuestos Markovianos y empeora la política.

Síntesis

Síntesis
Los MDP formalizan la toma de decisiones secuencial bajo incertidumbre y señalan la recursión de Bellman como principio computacional central; su aplicabilidad práctica depende de la capacidad para representar la información relevante en el estado y de si los modelos de transición/recompensa pueden conocerse o aprenderse con los recursos disponibles.