Zpět do práce
Stále pracuješ jako datový analytik/analytička pro webovou agenturu a byl/a jsi požádán/a o web scraping. Máš k dispozici seznam URL adres k analýze – tu jsi ostatně začal/a už v předchozí kapitole.
Předpokládáš, že tento úkol se bude opakovat: za pár týdnů tě o to nejspíš požádají znovu. Abys si příště usnadnil/a práci, rozhodl/a ses dnes napsat přehledný kód, ke kterému bude snadné se vrátit.
Začneme tím, že zkombinujeme dvě funkce z balíčku httr, které jsme viděli v předchozí kapitole: GET() pro načtení webové stránky a status_code() pro extrakci stavového kódu – a vytvoříme tak extraktor stavových kódů.
Vektor urls je stále dostupný v tvém pracovním prostředí. Zachovali jsme pouze URL adresy, které jsou dostupné.
Toto cvičení je součástí kurzu
Intermediate Functional Programming with purrr
Pokyny k cvičení
Načti balíčky
purrrahttr.Pomocí
GET()astatus_code()sestav extraktor stavových kódů.Vyzkoušej tuto novou funkci na adresách "https://www.thinkr.fr" a "https://en.wikipedia.org".
Namapuj tuto funkci přímo na vektor
urls.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Launch purrr and httr
# Compose a status extractor
status_extract <- ___(___, ___)
# Try with "https://thinkr.fr" & "https://en.wikipedia.org"
___("https://thinkr.fr")
___("https://en.wikipedia.org")
# Map it on the urls vector, return a vector of numbers
___(urls, ___)