Použití vzoru „nebo" na větším datasetu
Teď, kdy už rozumíš principu spojování více možností z vektoru, půjdeme o krok dál a aplikujeme to na větší dataset. V globálním prostředí máš k dispozici dvě proměnné: articles a politicians. První obsahuje sbírku zpravodajských článků o švýcarské politice, druhá je seznam jmen švýcarských politiků, kteří se v článcích vyskytují.
Tvým úkolem je zjistit, která jména se objevují v jednotlivých článcích a kolikrát se každý politik vyskytuje v celé sbírce článků.
Toto cvičení je součástí kurzu
Intermediate Regular Expressions in R
Pokyny k cvičení
- Pomocí vektoru
politiciansvytvoř regulární výraz, který odpovídá všem jménům uloženým v tomto vektoru. - Přidej do datového rámce
articlesnový sloupec, který bude obsahovat všechna jména politiků vyskytující se ve sloupcitext. - Spoj všechny články dohromady, aby bylo snazší spočítat počet výskytů pro každého politika.
- Předej vektor
politiciansjako vzor do funkcestr_count().
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Construct a pattern that searches for all politicians
polit_pattern <- glue_collapse(___, sep = "___")
# Use the pattern to match all names in the column "text"
articles %<>%
mutate(mentions = str_match_all(___, ___))
# Collapse all items of the column "text"
all_articles_in_one <- ___(articles$text)
# Pass the vector politicians to count all its elements
str_count(all_articles_in_one, ___)