Začněte nyníZačněte zdarma

Převod tabulky na datový rámec pomocí html_table()

Pokud má tabulka řádek záhlaví (s elementy th) a neobsahuje mezery, její scrapování je přímočaré – jako v případě následující tabulky (s ID "clean"):

Mountain Height First ascent Country
Mount Everest 8848 1953 Nepal, China
...

Tady je stejná tabulka (s ID "dirty"), která nemá vyhrazený řádek záhlaví a v prvním řádku chybí jedna buňka:

Mountain Height First ascent Country
Mount Everest 8848 1953
...

Pro takové případy má funkce html_table() navíc argument, který umožní tabulku správně zpracovat – jak bylo ukázáno ve videu. Chybějící buňky se automaticky rozpoznají a nahradí hodnotami NA.

Obě tabulky jsou obsaženy v dokumentu mountains_html.

Toto cvičení je součástí kurzu

Web Scraping v R

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Extract the "clean" table into a data frame 
mountains <- mountains_html %>% 
  html_element("table#clean") %>% 
  ___

mountains
Upravit a spustit kód