Začněte nyníZačněte zdarma

Extraktor obsahu

V předchozích cvičeních jsi ověřil/a, že všechny prvky vektoru URLs vrací stavový kód 200. Teď, když víš, že jsou dostupné, ponoříš se hlouběji do web scrapingu a zaměříš se na extrakci obsahu.

K tomu využijeme funkce z balíčku rvest, které předvyplníme pomocí partial(). Funkce, které v tomto cvičení napíšeš, budou z každé stránky extrahovat všechny HTML uzly H2 — na webové stránce tyto uzly odpovídají nadpisům druhé úrovně. Jakmile tyto nadpisy získáme, funkce html_text() z nich vyextrahuje textový obsah z nezpracovaného HTML.

purrr a rvest jsou už načtené a vektor urls máš k dispozici ve svém workspace.

Toto cvičení je součástí kurzu

Intermediate Functional Programming with purrr

Zobrazit kurz

Pokyny k cvičení

  • Začni předvyplněním funkce html_nodes() s argumentem css = "h2".

  • Nově vzniklou funkci zkombinuj s read_html a html_text tak, aby vznikl extraktor textu pro nadpisy H2.

  • Spusť tuto funkci na vektoru urls a výsledek pojmenuj.

  • Výsledek vypiš, abys viděl/a, jak vypadá.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Prefill html_nodes() with the css param set to h2
get_h2 <- ___(html_nodes, ___)

# Combine the html_text, get_h2 and read_html functions
get_content <- ___(___, ___, ___)

# Map get_content to the urls list
res <- ___(urls, ___) %>%
  set_names(___)

# Print the results to the console
___
Upravit a spustit kód