Zamień tabelę na ramkę danych za pomocą html_table()
Jeśli tabela ma wiersz nagłówkowy (z elementami th) i nie zawiera luk, jej scrapowanie jest proste – tak jak w przypadku poniższej tabeli (o ID "clean"):
| Mountain | Height | First ascent | Country |
|---|---|---|---|
| Mount Everest | 8848 | 1953 | Nepal, China |
| ... |
Oto ta sama tabela (o ID "dirty"), tym razem bez wyznaczonego wiersza nagłówkowego i z brakującą komórką w pierwszym wierszu:
| Mountain | Height | First ascent | Country |
| Mount Everest | 8848 | 1953 | |
| ... |
W takich przypadkach html_table() oferuje dodatkowy argument, który umożliwia poprawne parsowanie tabeli – dokładnie tak, jak pokazano w materiale wideo. Brakujące komórki są automatycznie rozpoznawane i zastępowane wartościami NA.
Obie tabele znajdują się w dokumencie mountains_html.
To ćwiczenie jest częścią kursu
Web Scraping w R
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Extract the "clean" table into a data frame
mountains <- mountains_html %>%
html_element("table#clean") %>%
___
mountains