Zacznij terazZacznij za darmo

Tworzenie obiektu tibble z korpusu

Aby dokładniej zbadać korpus danych o ropie naftowej otrzymany od współpracownika, postanowiłeś(-aś) stworzyć potok przetwarzania tekstu zawartego w dokumentach. Zamiast korzystać z pakietu tm, zdecydujesz się przekształcić korpus w obiekt tibble – dzięki temu będziesz mógł(-a) użyć już znanych ci funkcji: unnest_tokens(), count() i anti_join(). Korpus crude zawiera zarówno metadane, jak i treść każdego dokumentu.

To ćwiczenie jest częścią kursu

Wprowadzenie do przetwarzania języka naturalnego w R

Zobacz kurs

Instrukcje do ćwiczenia

  • Przekształć korpus w obiekt tibble.
  • Użyj names, aby wyświetlić nazwy kolumn.
  • Podziel tekst na tokeny (według słów), zlicz je i usuń stop words z kolumny text obiektu crude_tibble.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Create a tibble & Review
crude_tibble <- ___(crude)
___(crude_tibble)

crude_counts <- crude_tibble %>%
  # Tokenize by word 
  ___(___, text) %>%
  # Count by word
  ___(word, sort = TRUE) %>%
  # Remove stop words
  ___(stop_words)
Edytuj i uruchom kod