Začněte nyníZačněte zdarma

Zpět do práce

Stále pracuješ jako datový analytik/analytička pro webovou agenturu a byl/a jsi požádán/a o web scraping. Máš k dispozici seznam URL adres k analýze – tu jsi ostatně začal/a už v předchozí kapitole.

Předpokládáš, že tento úkol se bude opakovat: za pár týdnů tě o to nejspíš požádají znovu. Abys si příště usnadnil/a práci, rozhodl/a ses dnes napsat přehledný kód, ke kterému bude snadné se vrátit.

Začneme tím, že zkombinujeme dvě funkce z balíčku httr, které jsme viděli v předchozí kapitole: GET() pro načtení webové stránky a status_code() pro extrakci stavového kódu – a vytvoříme tak extraktor stavových kódů.

Vektor urls je stále dostupný v tvém pracovním prostředí. Zachovali jsme pouze URL adresy, které jsou dostupné.

Toto cvičení je součástí kurzu

Intermediate Functional Programming with purrr

Zobrazit kurz

Pokyny k cvičení

  • Načti balíčky purrr a httr.

  • Pomocí GET() a status_code() sestav extraktor stavových kódů.

  • Vyzkoušej tuto novou funkci na adresách "https://www.thinkr.fr" a "https://en.wikipedia.org".

  • Namapuj tuto funkci přímo na vektor urls.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Launch purrr and httr



# Compose a status extractor 
status_extract <- ___(___, ___)

# Try with "https://thinkr.fr" & "https://en.wikipedia.org"
___("https://thinkr.fr")
___("https://en.wikipedia.org")

# Map it on the urls vector, return a vector of numbers
___(urls, ___)
Upravit a spustit kód