CD501 — Aprendizado por Reforço

Ementa, programa e bibliografia da disciplina CD501.

← Voltar para a lista de disciplinas

  • Carga horária: 60 horas
  • Pré-requisito: CD303

Ementa

Introdução ao aprendizado por reforço. Processos decisórios de Markov. Programação dinâmica. Predição e controle livre de modelo. Métodos baseados em função valor. Métodos baseados em política. Gradiente de política. Exploração e aproveitamento. Aplicações em aprendizado por reforço.

Programa

1. Introdução ao aprendizado por reforço

  • Definição de aprendizado por reforço
  • Diferenças entre aprendizado supervisionado, não supervisionado e por reforço
  • Agente e ambiente
  • Estados, ações e recompensas
  • Interação agente-ambiente
  • Trajetórias e episódios
  • Objetivo de maximização de recompensa acumulada
  • Exemplos de problemas de decisão sequencial

2. Processos decisórios de Markov

  • Noção de processo estocástico

  • Estados e transições

  • Probabilidades de transição

  • Recompensas associadas às transições

  • Propriedade de Markov

  • Processos decisórios de Markov

  • Horizonte finito e horizonte infinito

  • Fator de desconto

  • Retorno esperado

3. Políticas e funções de valor

  • Definição de política
  • Políticas determinísticas e estocásticas
  • Avaliação de políticas
  • Melhoria de políticas
  • Função valor de estado
  • Função valor de ação
  • Relação entre política e função de valor
  • Política ótima
  • Função valor ótima

4. Programação dinâmica em aprendizado por reforço

  • Equações de Bellman
  • Avaliação iterativa de políticas
  • Melhoria iterativa de políticas
  • Iteração de políticas
  • Iteração de valores
  • Condições para aplicação de programação dinâmica
  • Limitações da programação dinâmica em ambientes desconhecidos
  • Relação entre programação dinâmica e aprendizado por reforço

5. Métodos de Monte Carlo

  • Estimativa de valores por amostragem
  • Aprendizado a partir de episódios completos
  • Métodos first-visit e every-visit
  • Avaliação de políticas por Monte Carlo
  • Controle por Monte Carlo
  • Exploração e aproveitamento
  • Políticas ε-greedy
  • Limitações dos métodos de Monte Carlo

6. Aprendizado por diferenças temporais

  • Diferenças temporais
  • Erro TD
  • Atualização incremental de valores
  • Comparação entre Monte Carlo e diferenças temporais
  • Algoritmo TD(0)
  • Aprendizado on-policy e off-policy
  • Algoritmo SARSA
  • Convergência intuitiva dos métodos TD

7. Q-Learning e métodos baseados em valor de ação

  • Definição da função Q
  • Atualização do Q-Learning
  • Aprendizado off-policy
  • Exploração com ε-greedy
  • Comparação entre SARSA e Q-Learning
  • Comparação entre Monte Carlo, TD e Q-Learning
  • Aplicação de Q-Learning em ambientes discretos
  • Análise de desempenho de políticas aprendidas

8. Aproximação de funções em aprendizado por reforço

  • Limitações dos métodos tabulares
  • Problemas com grande espaço de estados
  • Uso de aproximadores universais
  • Representação de funções de valor por redes neurais
  • Aproximação de funções de valor de estado
  • Aproximação de funções de valor de ação
  • Noções de Deep Q-Learning
  • Instabilidade e desafios no uso de redes neurais
  • Experimentos computacionais com aproximação de funções

Referências

  • SUTTON, Richard S.; BARTO, Andrew G. Reinforcement Learning: An Introduction. 2. ed. Cambridge: MIT Press, 2018.