Začněte nyníZačněte zdarma

Zparsování hypertextových odkazů do datového rámce

Podívej se na následující seznam ul s „užitečnými odkazy".

Sestává ze tří prvků li, které zase obsahují prvky a s odkazy:


Helpful links

Compiled with help from Google.


Odpovídající HTML kód je dostupný jako řetězec v proměnné hyperlink_raw_html.

V tomto cvičení tyto odkazy zparsujeme do datového rámce v R tak, že vybereme pouze prvky a, které se nacházejí uvnitř prvků li.

PS: Použijeme k tomu tibble(), funkci z Tidyverse. tibble() je v podstatě odlehčená verze data.frame(), kterou určitě znáš. Stejně jako u data.frame() zadáváš názvy sloupců a data jako dvojice název–hodnota:

my_tibble <- tibble(
  column_name_1 = value_1,
  column_name_2 = value_2,
  ...
)

Toto cvičení je součástí kurzu

Web Scraping v R

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Extract all the a nodes from the bulleted list
links <- hyperlink_raw_html %>% 
  read_html() %>% 
  html_elements('li ___')
Upravit a spustit kód