Aprendizaje por refuerzo
Aprende a construir agentes que toman decisiones secuenciales y mejoran con la experiencia. El curso va de los fundamentos del aprendizaje por refuerzo (procesos de decisión de Markov, funciones de valor y ecuaciones de Bellman) a los métodos de deep reinforcement learning que se usan hoy: DQN, gradientes de política, actor-crítico y PPO.
Qué incluye: 11 temas y 4 entregas evaluables
- Módulo 1 · Fundamentos — Tema 1 Introducción al aprendizaje por refuerzo · Tema 2 Entornos de simulación con Gymnasium · Tema 3 Procesos de decisión de Markov
- Módulo 2 · Soluciones tabulares — Tema 4 Programación dinámica · Tema 5 Monte Carlo · Tema 6 Diferencia temporal · Tema 7 Métodos de n pasos · Práctica 1: métodos tabulares en Blackjack
- Módulo 3 · Soluciones aproximadas y deep RL — Tema 8 Soluciones aproximadas · Tema 9 Deep Q-Networks · Tema 10 Gradientes de política · Tema 11 Actor-crítico · Práctica 2: deep RL en Space Invaders
- Cierre — Entrega 3: análisis crítico de un artículo científico · Proyecto final: agente para Lunar Lander
Cada tema trae un PDF propio, un notebook de entrenamiento con ejercicios autocorregibles y su solución, y una autoevaluación que desbloquea el tema siguiente.
Trabajarás en Python con Gymnasium y PyTorch, en local o en Google Colab. Dedicación estimada: 140 horas (unas 10 horas semanales durante 14 semanas). Requisitos: Python y numpy, probabilidad básica y cálculo; para el módulo 3, nociones de redes neuronales.