Przechwytywanie metadanych w tm
W zależności od celu analizy możesz chcieć zachować metadane dokumentu podczas tworzenia korpusu.
Aby przechwycić metadane na poziomie dokumentu, nazwy i kolejność kolumn muszą być następujące:
doc_id– unikalny ciąg znaków dla każdego dokumentutext– tekst przeznaczony do analizy...– wszystkie pozostałe kolumny zostaną automatycznie skatalogowane jako metadane.
Czasem trzeba zmienić nazwy kolumn, żeby spełnić wymagania funkcji DataframeSource(). Przydaje się do tego funkcja names().
W twoim środowisku pracy istnieje ramka danych tweets z kolumnami "num", "text", "screenName" i "created".
To ćwiczenie jest częścią kursu
Eksploracja tekstu metodą Bag-of-Words w R
Instrukcje do ćwiczenia
- Zmień nazwę pierwszej kolumny
tweetsna "doc_id". - Zdefiniuj schemat dokumentu, stosując
DataframeSource()na mniejszej ramce danychtweets. - Przekształć kolekcję dokumentów w zmienny korpus zagnieżdżony w niestandardowej funkcji
clean_corpus(). - Zastosuj
content()do pierwszego tweeta, używając podwójnych nawiasów kwadratowych, np.text_corpus[[1]], aby zobaczyć oczyszczony tekst. - Sprawdź, czy wszystkie metadane zostały przechwycone, używając funkcji
meta()na pierwszym dokumencie z pojedynczymi nawiasami kwadratowymi.
Pamiętaj, że przy dostępie do elementów korpusu podwójne lub pojedyncze nawiasy kwadratowe mają znaczenie! W tym ćwiczeniu użyj podwójnych nawiasów z content() i pojedynczych nawiasów z meta().
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Rename columns
___(tweets)[1] <- "___"
# Set the schema: docs
docs <- ___(___)
# Make a clean volatile corpus: text_corpus
text_corpus <- clean_corpus(___(___))
# Examine the first doc content
___(text_corpus[[___]])
# Access the first doc metadata
___(text_corpus[___])