ÎncepețiÎncepe gratuit

Transformă un tabel într-un data frame cu html_table()

Dacă un tabel are un rând de antet (cu elemente th) și nu are celule lipsă, extragerea datelor din el este simplă, ca în cazul tabelului următor (cu ID-ul "clean"):

Mountain Height First ascent Country
Mount Everest 8848 1953 Nepal, China
...

Iată același tabel (cu ID-ul "dirty"), de această dată fără un rând de antet dedicat și cu o celulă lipsă în primul rând:

Mountain Height First ascent Country
Mount Everest 8848 1953
...

Pentru astfel de cazuri, html_table() dispune de un argument suplimentar care te ajută să parsezi corect tabelul, după cum s-a arătat în video. Celulele lipsă sunt recunoscute automat și înlocuite cu valori NA.

Ambele tabele se află în documentul mountains_html.

Acest exercițiu face parte din cursul

Web Scraping în R

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Extract the "clean" table into a data frame 
mountains <- mountains_html %>% 
  html_element("table#clean") %>% 
  ___

mountains
Editează și rulează codul