BoW-exempel
Vid litteraturöversikter läser och sammanfattar forskare så många tillgängliga texter om ett ämne som möjligt. Ibland stöter de på dubbletter eller sammanfattningar av artiklar de redan har läst. Du har fått tillgång till 20 artiklar om råolja i ett R-objekt med namnet crude_tibble. I stället för att direkt börja läsa varje artikel har du bestämt dig för att undersöka vilka ord som förekommer i flera av dem. För att göra det börjar du med att bygga en bag-of-words-representation av texten.
Den här övningen är en del av kursen
Introduktion till naturlig språkbehandling i R
Övningsinstruktioner
- Skapa en BoW-representation genom att räkna antalet ord per artikel med hjälp av kolumnen
article_id. - Använd utdata för att avgöra hur många unika artikel/ord-kombinationer som skapades.
- Filtrera resultaten på förekomster av
'prices'. - I hur många artiklar används ordet
prices?
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Count occurrence by article_id and word
words <- crude_tibble %>%
unnest_tokens(output = "word", token = "words", input = text) %>%
anti_join(stop_words) %>%
count(___, ___, sort=TRUE)
# How many different word/article combinations are there?
unique_combinations <- nrow(___)
# Filter to responses with the word "prices"
words_with_prices <- words %>%
___(word == "___")
# How many articles had the word "prices"?
number_of_price_articles <- nrow(___)