Introdução ao curso
setembro de 2025
Conhecimento básico de R e tidyverse.
Na página do curso, indiquei alguns materiais que podem ajudar a relembrar ou aprender esses conceitos.
Esse curso não é sobre introdução ao R, mas sim de raspagem de dados com R.
O curso abordará conceitos, como:
O que é raspagem de dados?;
Política de uso;
Tipos de problemas de raspagem
APIs disponíveis e “escondidas”;
Raspagem de HTML (estático e dinâmico);
Envolve acessar, baixar e organizar dados provenientes da web.
Em inglês chamamos de “web scraping”.
Muito do que vemos na internet pode se transformar dados para analisar!
Existem formas mais simples de obter os dados (API, base de dados, etc.)
Os termos de uso do site não nos permitem fazer isso.
As informações do site não são públicas.
Risco de derrubar ou comprometer a estabilidade do site.
Vale à pena conversar com a entidade detentora dos dados.
APIs disponíveis: O site fornece uma forma estruturada e documentada para acessar as páginas (com ou sem necessidade de fazer login).
APIs escondidas: O site não fornece uma forma estruturada e documentada para acessar as páginas, mas internamente é alimentado por uma API não documentada, que podemos descobrir e usar.
HTML estático: O site não fornece uma forma estruturada de acessar as páginas, e as páginas são geradas de forma estática (carregam sem necessidade de usar um navegador).
HTML dinâmico: O site não fornece uma forma estruturada de acessar as páginas, e as páginas são geradas de forma dinâmica.
…
Veremos exemplos de raspagem de dados em cada um desses tipos de problemas.

Slides por Beatriz Milz, feitos com Quarto. Códigos e materiais disponíveis no GitHub. Licença de uso: CC-BY-SA.