ÎncepețiÎncepe gratuit

Parsează hyperlinkuri într-un data frame

Aruncă o privire la următoarea listă ul de „linkuri utile".

Aceasta conține trei elemente li care, la rândul lor, conțin elemente a cu linkurile:


Helpful links

Compiled with help from Google.


Codul HTML corespunzător este disponibil ca șir de caractere în hyperlink_raw_html.

În acest exercițiu, vei parsa aceste linkuri într-un data frame R, selectând doar elementele a care se află în interiorul elementelor li.

PS: Vei folosi tibble(), o funcție din Tidyverse. tibble() este practic o versiune simplificată a data.frame(), pe care cu siguranță o cunoști deja. La fel ca data.frame(), specifici numele coloanelor și datele ca perechi de nume și valori, astfel:

my_tibble <- tibble(
  column_name_1 = value_1,
  column_name_2 = value_2,
  ...
)

Acest exercițiu face parte din cursul

Web Scraping în R

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Extract all the a nodes from the bulleted list
links <- hyperlink_raw_html %>% 
  read_html() %>% 
  html_elements('li ___')
Editează și rulează codul