El Aprendizaje por Refuerzo (RL, por sus siglas en inglés) es una rama del aprendizaje automático que se enfoca en que un agente tome decisiones óptimas en un ambiente dinámico desconocido. El agente aprende a través de la retroalimentación de su comportamiento en forma de recompensas y castigos.
Los algoritmos elementales de RL son aquellos que se utilizan para resolver problemas básicos de RL. Entre estos algoritmos se encuentran el método de Iteración de Valor (VI) y el método de Iteración de Política (PI). En VI, el agente actualiza iterativamente su función de valor de estado hasta converger a la solución óptima. En PI, el agente actualiza su política iterativamente hasta que se encuentra la política óptima.
Otro algoritmo elemental es el de Montecarlo, que estima la función de valor de estado mediante la simulación de episodios completos, y el de TD (Temporal Difference), que actualiza la función de valor de estado en cada paso del episodio.
En general, los algoritmos elementales de RL proporcionan una base sólida para comprender y resolver problemas más complejos de RL.