Typowe funkcje czyszczące z pakietu tm
Teraz, gdy znasz już dwa sposoby tworzenia korpusu, możesz skupić się na czyszczeniu i wstępnym przetwarzaniu tekstu. Zaczniesz od oczyszczenia krótkiego fragmentu tekstu, a następnie przejdziesz do pracy z większymi korpusami.
W metodzie bag-of-words czyszczenie tekstu pomaga agregować terminy. Na przykład słowa „miner", „mining" i „mine" warto traktować jako jeden termin. Konkretne kroki przetwarzania wstępnego zależą od projektu – słownictwo używane na Twitterze znacznie różni się od języka dokumentów prawnych, więc i proces czyszczenia może wyglądać zupełnie inaczej.
Do najczęściej stosowanych funkcji przetwarzania wstępnego należą:
tolower(): zamienia wszystkie znaki na małe literyremovePunctuation(): usuwa wszystkie znaki interpunkcyjneremoveNumbers(): usuwa liczbystripWhitespace(): usuwa nadmiarowe białe znaki
Funkcja tolower() pochodzi z podstawowego R, natomiast pozostałe trzy funkcje są dostępne w pakiecie tm. W kolejnych ćwiczeniach pakiety tm i qdap będą wczytywane automatycznie, gdy tylko będą potrzebne. Za każdym razem, gdy pojawi się nowy pakiet, najpierw samodzielnie go wczytasz.
W skrypcie znajdziesz zmienną text zawierającą przykładowe zdanie.
To ćwiczenie jest częścią kursu
Eksploracja tekstu metodą Bag-of-Words w R
Instrukcje do ćwiczenia
Zastosuj każdą z poniższych funkcji do zmiennej text, wyświetlając wyniki w konsoli:
- `tolower()`
- `removePunctuation()`
- `removeNumbers()`
- `stripWhitespace()`
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create the object: text
text <- "She woke up at 6 A.M. It\'s so early! She was only 10% awake and began drinking coffee in front of her computer."
# Make lowercase
___
# Remove punctuation
____
# Remove numbers
___
# Remove whitespace
___