Kom igångKom igång gratis

Skapa en tibble från ett korpus

För att utforska korpuset med råoljedata som du fick av en kollega har du bestämt dig för att skapa en pipeline som rensar texten i dokumenten. Istället för att använda tm-paketet har du valt att omvandla korpuset till en tibble, så att du kan använda de bekanta funktionerna unnest_tokens(), count() och anti_join(). Korpuset crude innehåller både metadata och text för varje dokument.

Den här övningen är en del av kursen

Introduktion till naturlig språkbehandling i R

Visa kurs

Övningsinstruktioner

  • Omvandla korpuset till en tibble.
  • Använd names för att skriva ut kolumnnamnen.
  • Tokenisera (per ord), räkna och ta bort stoppord från kolumnen text i crude_tibble.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Create a tibble & Review
crude_tibble <- ___(crude)
___(crude_tibble)

crude_counts <- crude_tibble %>%
  # Tokenize by word 
  ___(___, text) %>%
  # Count by word
  ___(word, sort = TRUE) %>%
  # Remove stop words
  ___(stop_words)
Redigera och kör kod