Powtórka z TM (I)
W kursie Text Mining: Bag of Words poznałeś pojęcie korpusu jako zbioru tekstów oraz funkcje do wstępnego przetwarzania tekstu. Warto je sobie przypomnieć – analiza sentymentu jest częścią text miningu, więc krótka powtórka się przyda.
- Zamień wektor znaków na źródło tekstowe za pomocą
VectorSource(). - Przekształć źródło tekstowe w korpus za pomocą
VCorpus(). - Usuń niechciane znaki z korpusu, korzystając z funkcji czyszczących, takich jak
removePunctuation()istripWhitespace()z pakietutmorazreplace_abbreviation()z pakietuqdap.
W tym ćwiczeniu przygotowano niestandardową funkcję clean_corpus(), która łączy standardowe kroki przetwarzania tekstu w jedną wygodną funkcję.
clean_corpus() przyjmuje wynik działania VCorpus() i stosuje funkcje czyszczące. Na przykład:
processed_corpus <- clean_corpus(my_corpus)
To ćwiczenie jest częścią kursu
Analiza sentymentu w R
Instrukcje do ćwiczenia
W sesji R dostępny jest wektor tekstowy tm_define zawierający dwa krótkie dokumenty oraz funkcja clean_corpus().
- Utwórz obiekt
tm_vector, stosującVectorSource()natm_define. - Utwórz
tm_corpus, wywołującVCorpus()natm_vector. - Użyj
content(), aby sprawdzić zawartość pierwszego dokumentu wtm_corpus.- Dokumenty w korpusie są dostępne za pomocą składni listowej – użyj podwójnych nawiasów kwadratowych, np.
[[1]].
- Dokumenty w korpusie są dostępne za pomocą składni listowej – użyj podwójnych nawiasów kwadratowych, np.
- Oczyść tekst korpusu, stosując niestandardową funkcję
clean_corpus()natm_corpus. Nowy obiekt nazwijtm_clean. - Sprawdź ponownie pierwszy dokument obiektu
tm_clean, aby zobaczyć, jak tekst zmienił się po zastosowaniuclean_corpus().
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# clean_corpus(), tm_define are pre-defined
clean_corpus
tm_define
# Create a VectorSource
tm_vector <- ___
# Apply VCorpus
tm_corpus <- ___
# Examine the first document's contents
___(___[[___]])
# Clean the text
tm_clean <- ___
# Reexamine the contents of the first doc
___