Zacznij terazZacznij za darmo

Powtórka z TM (I)

W kursie Text Mining: Bag of Words poznałeś pojęcie korpusu jako zbioru tekstów oraz funkcje do wstępnego przetwarzania tekstu. Warto je sobie przypomnieć – analiza sentymentu jest częścią text miningu, więc krótka powtórka się przyda.

W tym ćwiczeniu przygotowano niestandardową funkcję clean_corpus(), która łączy standardowe kroki przetwarzania tekstu w jedną wygodną funkcję.

clean_corpus() przyjmuje wynik działania VCorpus() i stosuje funkcje czyszczące. Na przykład:

processed_corpus <- clean_corpus(my_corpus)

To ćwiczenie jest częścią kursu

Analiza sentymentu w R

Zobacz kurs

Instrukcje do ćwiczenia

W sesji R dostępny jest wektor tekstowy tm_define zawierający dwa krótkie dokumenty oraz funkcja clean_corpus().

  • Utwórz obiekt tm_vector, stosując VectorSource() na tm_define.
  • Utwórz tm_corpus, wywołując VCorpus() na tm_vector.
  • Użyj content(), aby sprawdzić zawartość pierwszego dokumentu w tm_corpus.
    • Dokumenty w korpusie są dostępne za pomocą składni listowej – użyj podwójnych nawiasów kwadratowych, np. [[1]].
  • Oczyść tekst korpusu, stosując niestandardową funkcję clean_corpus() na tm_corpus. Nowy obiekt nazwij tm_clean.
  • Sprawdź ponownie pierwszy dokument obiektu tm_clean, aby zobaczyć, jak tekst zmienił się po zastosowaniu clean_corpus().

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# clean_corpus(), tm_define are pre-defined
clean_corpus
tm_define

# Create a VectorSource
tm_vector <- ___

# Apply VCorpus
tm_corpus <- ___

# Examine the first document's contents
___(___[[___]])

# Clean the text
tm_clean <- ___

# Reexamine the contents of the first doc
___
Edytuj i uruchom kod