Extraktor obsahu
V předchozích cvičeních jsi ověřil/a, že všechny prvky vektoru URLs vrací stavový kód 200. Teď, když víš, že jsou dostupné, ponoříš se hlouběji do web scrapingu a zaměříš se na extrakci obsahu.
K tomu využijeme funkce z balíčku rvest, které předvyplníme pomocí partial(). Funkce, které v tomto cvičení napíšeš, budou z každé stránky extrahovat všechny HTML uzly H2 — na webové stránce tyto uzly odpovídají nadpisům druhé úrovně. Jakmile tyto nadpisy získáme, funkce html_text() z nich vyextrahuje textový obsah z nezpracovaného HTML.
purrr a rvest jsou už načtené a vektor urls máš k dispozici ve svém workspace.
Toto cvičení je součástí kurzu
Intermediate Functional Programming with purrr
Pokyny k cvičení
Začni předvyplněním funkce
html_nodes()s argumentemcss = "h2".Nově vzniklou funkci zkombinuj s
read_htmlahtml_texttak, aby vznikl extraktor textu pro nadpisyH2.Spusť tuto funkci na vektoru
urlsa výsledek pojmenuj.Výsledek vypiš, abys viděl/a, jak vypadá.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Prefill html_nodes() with the css param set to h2
get_h2 <- ___(html_nodes, ___)
# Combine the html_text, get_h2 and read_html functions
get_content <- ___(___, ___, ___)
# Map get_content to the urls list
res <- ___(urls, ___) %>%
set_names(___)
# Print the results to the console
___