Zparsování hypertextových odkazů do datového rámce
Podívej se na následující seznam ul s „užitečnými odkazy".
Sestává ze tří prvků li, které zase obsahují prvky a s odkazy:
Helpful links
Compiled with help from Google.
Odpovídající HTML kód je dostupný jako řetězec v proměnné hyperlink_raw_html.
V tomto cvičení tyto odkazy zparsujeme do datového rámce v R tak, že vybereme pouze prvky a, které se nacházejí uvnitř prvků li.
PS: Použijeme k tomu tibble(), funkci z Tidyverse. tibble() je v podstatě odlehčená verze data.frame(), kterou určitě znáš. Stejně jako u data.frame() zadáváš názvy sloupců a data jako dvojice název–hodnota:
my_tibble <- tibble(
column_name_1 = value_1,
column_name_2 = value_2,
...
)
Toto cvičení je součástí kurzu
Web Scraping v R
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Extract all the a nodes from the bulleted list
links <- hyperlink_raw_html %>%
read_html() %>%
html_elements('li ___')