Parsează hyperlinkuri într-un data frame
Aruncă o privire la următoarea listă ul de „linkuri utile".
Aceasta conține trei elemente li care, la rândul lor, conțin elemente a cu linkurile:
Helpful links
Compiled with help from Google.
Codul HTML corespunzător este disponibil ca șir de caractere în hyperlink_raw_html.
În acest exercițiu, vei parsa aceste linkuri într-un data frame R, selectând doar elementele a care se află în interiorul elementelor li.
PS: Vei folosi tibble(), o funcție din Tidyverse. tibble() este practic o versiune simplificată a data.frame(), pe care cu siguranță o cunoști deja. La fel ca data.frame(), specifici numele coloanelor și datele ca perechi de nume și valori, astfel:
my_tibble <- tibble(
column_name_1 = value_1,
column_name_2 = value_2,
...
)
Acest exercițiu face parte din cursul
Web Scraping în R
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Extract all the a nodes from the bulleted list
links <- hyperlink_raw_html %>%
read_html() %>%
html_elements('li ___')