ÎncepețiÎncepe gratuit

Iterații sigure

Ca și în capitolul anterior, să presupunem că ești un analist de date care lucrează pentru o agenție web. De această dată, ai primit sarcina de a face web scraping.

(Notă: nu te îngrijora dacă nu știi cum funcționează web scraping-ul – vom începe simplu, iar toate funcțiile vor fi explicate).

Ai primit o listă de URL-uri, dar bănuiești că unele nu sunt adrese reale. Primul lucru pe care îl vei face este să testezi dacă te poți conecta la aceste URL-uri. Pentru asta, vom folosi o funcție simplă din pachetul readr: read_lines(), pe care o vom integra într-un apel safely(). Când primește un URL, read_lines() citește codul HTML sau returnează o eroare dacă URL-ul nu este accesibil.

Vectorul urls este disponibil în spațiul tău de lucru. Afișează-l în consolă dacă vrei să vezi ce conține.

Acest exercițiu face parte din cursul

Programare funcțională intermediară cu purrr

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează o versiune sigură a funcției read_lines().

  • Aplică această nouă funcție pe vectorul furnizat, numit urls, folosind map().

  • Setează numele rezultatelor cu funcția set_names().

  • Extrage elementul "error" din fiecare sublista.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create a safe version of read_lines()
safe_read <- ___(___)

# Map it on the urls vector
res <- ___(urls, ___)

# Set the name of the results to `urls`
named_res <- ___(res, ___)

# Extract only the "error" part of each sublist
___(named_res, ___)
Editează și rulează codul