Skapa en tibble från ett korpus
För att utforska korpuset med råoljedata som du fick av en kollega har du bestämt dig för att skapa en pipeline som rensar texten i dokumenten. Istället för att använda tm-paketet har du valt att omvandla korpuset till en tibble, så att du kan använda de bekanta funktionerna unnest_tokens(), count() och anti_join(). Korpuset crude innehåller både metadata och text för varje dokument.
Den här övningen är en del av kursen
Introduktion till naturlig språkbehandling i R
Övningsinstruktioner
- Omvandla korpuset till en tibble.
- Använd
namesför att skriva ut kolumnnamnen. - Tokenisera (per ord), räkna och ta bort stoppord från kolumnen
texticrude_tibble.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create a tibble & Review
crude_tibble <- ___(crude)
___(crude_tibble)
crude_counts <- crude_tibble %>%
# Tokenize by word
___(___, text) %>%
# Count by word
___(word, sort = TRUE) %>%
# Remove stop words
___(stop_words)