Převod tabulky na datový rámec pomocí html_table()
Pokud má tabulka řádek záhlaví (s elementy th) a neobsahuje mezery, její scrapování je přímočaré – jako v případě následující tabulky (s ID "clean"):
| Mountain | Height | First ascent | Country |
|---|---|---|---|
| Mount Everest | 8848 | 1953 | Nepal, China |
| ... |
Tady je stejná tabulka (s ID "dirty"), která nemá vyhrazený řádek záhlaví a v prvním řádku chybí jedna buňka:
| Mountain | Height | First ascent | Country |
| Mount Everest | 8848 | 1953 | |
| ... |
Pro takové případy má funkce html_table() navíc argument, který umožní tabulku správně zpracovat – jak bylo ukázáno ve videu. Chybějící buňky se automaticky rozpoznají a nahradí hodnotami NA.
Obě tabulky jsou obsaženy v dokumentu mountains_html.
Toto cvičení je součástí kurzu
Web Scraping v R
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Extract the "clean" table into a data frame
mountains <- mountains_html %>%
html_element("table#clean") %>%
___
mountains