Kom igångKom igång gratis

Glesa matriser

I videolektionen lärde du dig om glesa matriser. Glesa matriser kan bli beräkningsmässiga mardrömmar när antalet textdokument och antalet unika ord växer. Att skapa ordrepresentationer med tweets kan lätt ge upphov till glesa matriser, eftersom emojis, slang, akronymer och andra språkformer används.

I den här övningen går du igenom stegen för att beräkna hur gles datamängden med ryska tweets är. Observera att det här är ett litet exempel på hur snabbt textanalys kan bli ett stort beräkningsmässigt problem.

Den här övningen är en del av kursen

Introduktion till naturlig språkbehandling i R

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Tokenize and remove stop words
tidy_tweets <- russian_tweets %>%
  ___(word, content) %>%
  ___(stop_words)
# Count by word
unique_words <- tidy_tweets %>%
  count(___)
Redigera och kör kod