Zacznij terazZacznij za darmo

Zamień tabelę na ramkę danych za pomocą html_table()

Jeśli tabela ma wiersz nagłówkowy (z elementami th) i nie zawiera luk, jej scrapowanie jest proste – tak jak w przypadku poniższej tabeli (o ID "clean"):

Mountain Height First ascent Country
Mount Everest 8848 1953 Nepal, China
...

Oto ta sama tabela (o ID "dirty"), tym razem bez wyznaczonego wiersza nagłówkowego i z brakującą komórką w pierwszym wierszu:

Mountain Height First ascent Country
Mount Everest 8848 1953
...

W takich przypadkach html_table() oferuje dodatkowy argument, który umożliwia poprawne parsowanie tabeli – dokładnie tak, jak pokazano w materiale wideo. Brakujące komórki są automatycznie rozpoznawane i zastępowane wartościami NA.

Obie tabele znajdują się w dokumencie mountains_html.

To ćwiczenie jest częścią kursu

Web Scraping w R

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Extract the "clean" table into a data frame 
mountains <- mountains_html %>% 
  html_element("table#clean") %>% 
  ___

mountains
Edytuj i uruchom kod