CD603 — Visão Computacional

Ementa, programa e bibliografia da disciplina CD603.

← Voltar para a lista de disciplinas

  • Carga horária: 60 horas
  • Pré-requisito: CD503 + CD402

Ementa

Conceitos básicos de processamento digital de imagens, filtragem, realce e melhoria da qualidade visual. Bordas e segmentação. Coordenadas homogêneas, projeções, câmeras e calibração. Reconhecimento de Padrões. Redes neurais convolucionais aplicadas à visão computacional. Classificação, detecção, segmentação e reconhecimento em imagens.

Programa

1. Introdução à visão computacional

  • Conceitos fundamentais de visão computacional
  • Diferenças entre processamento de imagens e visão computacional
  • Aquisição, representação e interpretação de imagens
  • Pixels, resolução, canais e espaços de cor
  • Imagem como matriz e como sinal visual
  • Aplicações em reconhecimento, inspeção, medicina e sistemas autônomos

2. Fundamentos de processamento digital de imagens

  • Representação digital de imagens
  • Amostragem e quantização
  • Histogramas de intensidade
  • Operações ponto a ponto
  • Transformações de intensidade
  • Normalização de imagens
  • Conversão entre espaços de cor
  • Noções de ruído em imagens digitais

3. Filtragem, realce e melhoria de imagens

  • Filtros lineares e não lineares

  • Convolução em imagens

  • Suavização e remoção de ruído

  • Filtro de média

  • Filtro gaussiano

  • Filtro de mediana

  • Realce de contraste

  • Equalização de histograma

  • Melhoria da qualidade visual de imagens

4. Bordas, contornos e segmentação

  • Detecção de bordas
  • Gradiente de imagem
  • Operadores de Sobel, Prewitt e Canny
  • Contornos e regiões
  • Segmentação por limiarização
  • Segmentação baseada em regiões
  • Segmentação baseada em agrupamento
  • Operações morfológicas
  • Avaliação de resultados de segmentação

5. Características visuais e correspondências

  • Pontos de interesse
  • Descritores locais
  • Características de forma, textura e cor
  • Correspondência entre imagens
  • Similaridade entre descritores
  • Casamento de pontos
  • Remoção de correspondências incorretas
  • Aplicações em alinhamento e reconhecimento

6. Álgebra linear e geometria para visão computacional

  • Vetores, matrizes e transformações lineares
  • Sistemas de coordenadas
  • Coordenadas homogêneas
  • Transformações geométricas em imagens
  • Translação, escala e rotação
  • Representações de rotações
  • Transformações rígidas e afins
  • Relação entre geometria e formação de imagens

7. Projeções, câmeras e calibração

  • Modelo de câmera
  • Projeção ortográfica
  • Projeção perspectiva
  • Projeção afim
  • Parâmetros intrínsecos e extrínsecos
  • Calibração de câmeras
  • Distorções de lente
  • Relação entre pontos 3D e pontos projetados na imagem

8. Homografia e geometria de múltiplas vistas

  • Homografia
  • Transformações entre planos
  • Geometria epipolar
  • Matriz fundamental
  • Matriz essencial
  • Correspondências entre múltiplas imagens
  • Estimação robusta com RANSAC
  • Aplicações em registro de imagens, panoramas e reconstrução

9. Reconstrução, movimento e fatorização

  • Noções de reconstrução 3D

  • Estrutura a partir do movimento

  • Fatorização rígida

  • Fatorização não rígida

  • Estimativa de movimento

  • Fluxo óptico

  • Relação entre movimento de câmera e movimento de objetos

  • Limitações de reconstrução a partir de imagens

10. Rastreamento em visão computacional

  • Conceitos de rastreamento visual
  • Rastreamento de pontos
  • Rastreamento de objetos
  • Filtro de Kalman
  • Filtro de partículas
  • Atualização de estado ao longo do tempo
  • Oclusões e mudanças de aparência
  • Aplicações em vídeo, robótica e sistemas autônomos

11. Reconhecimento de padrões em imagens

  • Extração de características
  • Representação de imagens por vetores de atributos
  • Classificação de imagens
  • Reconhecimento de objetos
  • Reconhecimento facial
  • Reconhecimento baseado em características locais
  • Avaliação de classificadores
  • Métricas de desempenho em tarefas de visão computacional

12. Redes neurais convolucionais

  • Fundamentos de redes neurais convolucionais
  • Operação de convolução em redes neurais
  • Filtros aprendidos
  • Camadas convolucionais
  • Camadas de pooling
  • Arquiteturas convolucionais profundas
  • Treinamento de modelos convolucionais
  • Transferência de aprendizado
  • Uso de redes pré-treinadas

13. Classificação, detecção e segmentação com aprendizado profundo

  • Classificação de imagens com CNNs
  • Detecção de objetos
  • Localização de objetos em imagens
  • Segmentação semântica
  • Segmentação de instâncias
  • Reconhecimento de múltiplos objetos
  • Avaliação de modelos de detecção e segmentação
  • Aplicações com bases de imagens reais

14. Aplicações e estudos de caso

  • Reconhecimento facial
  • Análise de imagens médicas
  • Inspeção visual automatizada
  • Visão computacional em sistemas autônomos
  • Visão computacional em robótica
  • Aplicações em segurança, mobilidade e indústria
  • Limitações técnicas e éticas em sistemas de visão computacional
  • Desenvolvimento de atividades práticas e estudos de caso

Referências

  • PEDRINI, Hélio; SCHWARTZ, William Robson. Análise de imagens digitais. São Paulo: Cengage Learning, 2007.
  • SZELISKI, Richard. Computer Vision: Algorithms and Applications. London: Springer, 2011.
  • GOODFELLOW, Ian; BENGIO, Yoshua; COURVILLE, Aaron. Deep Learning. Cambridge, MA: MIT Press, 2016.