Tworzenie obiektu tibble z korpusu
Aby dokładniej zbadać korpus danych o ropie naftowej otrzymany od współpracownika, postanowiłeś(-aś) stworzyć potok przetwarzania tekstu zawartego w dokumentach. Zamiast korzystać z pakietu tm, zdecydujesz się przekształcić korpus w obiekt tibble – dzięki temu będziesz mógł(-a) użyć już znanych ci funkcji: unnest_tokens(), count() i anti_join(). Korpus crude zawiera zarówno metadane, jak i treść każdego dokumentu.
To ćwiczenie jest częścią kursu
Wprowadzenie do przetwarzania języka naturalnego w R
Instrukcje do ćwiczenia
- Przekształć korpus w obiekt tibble.
- Użyj
names, aby wyświetlić nazwy kolumn. - Podziel tekst na tokeny (według słów), zlicz je i usuń stop words z kolumny
textobiektucrude_tibble.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create a tibble & Review
crude_tibble <- ___(crude)
___(crude_tibble)
crude_counts <- crude_tibble %>%
# Tokenize by word
___(___, text) %>%
# Count by word
___(word, sort = TRUE) %>%
# Remove stop words
___(stop_words)