CD501 — Aprendizado por Reforço
Ementa, programa e bibliografia da disciplina CD501.
← Voltar para a lista de disciplinas
Ementa
Introdução ao aprendizado por reforço. Processos decisórios de Markov. Programação dinâmica. Predição e controle livre de modelo. Métodos baseados em função valor. Métodos baseados em política. Gradiente de política. Exploração e aproveitamento. Aplicações em aprendizado por reforço.
Programa
1. Introdução ao aprendizado por reforço
- Definição de aprendizado por reforço
- Diferenças entre aprendizado supervisionado, não supervisionado e por reforço
- Agente e ambiente
- Estados, ações e recompensas
- Interação agente-ambiente
- Trajetórias e episódios
- Objetivo de maximização de recompensa acumulada
- Exemplos de problemas de decisão sequencial
2. Processos decisórios de Markov
Noção de processo estocástico
Estados e transições
Probabilidades de transição
Recompensas associadas às transições
Propriedade de Markov
Processos decisórios de Markov
Horizonte finito e horizonte infinito
Fator de desconto
Retorno esperado
3. Políticas e funções de valor
- Definição de política
- Políticas determinísticas e estocásticas
- Avaliação de políticas
- Melhoria de políticas
- Função valor de estado
- Função valor de ação
- Relação entre política e função de valor
- Política ótima
- Função valor ótima
4. Programação dinâmica em aprendizado por reforço
- Equações de Bellman
- Avaliação iterativa de políticas
- Melhoria iterativa de políticas
- Iteração de políticas
- Iteração de valores
- Condições para aplicação de programação dinâmica
- Limitações da programação dinâmica em ambientes desconhecidos
- Relação entre programação dinâmica e aprendizado por reforço
5. Métodos de Monte Carlo
- Estimativa de valores por amostragem
- Aprendizado a partir de episódios completos
- Métodos first-visit e every-visit
- Avaliação de políticas por Monte Carlo
- Controle por Monte Carlo
- Exploração e aproveitamento
- Políticas ε-greedy
- Limitações dos métodos de Monte Carlo
6. Aprendizado por diferenças temporais
- Diferenças temporais
- Erro TD
- Atualização incremental de valores
- Comparação entre Monte Carlo e diferenças temporais
- Algoritmo TD(0)
- Aprendizado on-policy e off-policy
- Algoritmo SARSA
- Convergência intuitiva dos métodos TD
7. Q-Learning e métodos baseados em valor de ação
- Definição da função Q
- Atualização do Q-Learning
- Aprendizado off-policy
- Exploração com ε-greedy
- Comparação entre SARSA e Q-Learning
- Comparação entre Monte Carlo, TD e Q-Learning
- Aplicação de Q-Learning em ambientes discretos
- Análise de desempenho de políticas aprendidas
8. Aproximação de funções em aprendizado por reforço
- Limitações dos métodos tabulares
- Problemas com grande espaço de estados
- Uso de aproximadores universais
- Representação de funções de valor por redes neurais
- Aproximação de funções de valor de estado
- Aproximação de funções de valor de ação
- Noções de Deep Q-Learning
- Instabilidade e desafios no uso de redes neurais
- Experimentos computacionais com aproximação de funções
Referências
- SUTTON, Richard S.; BARTO, Andrew G. Reinforcement Learning: An Introduction. 2. ed. Cambridge: MIT Press, 2018.