Tworzenie VCorpus z ramki danych
Jeśli dane tekstowe znajdują się w ramce danych, do analizy możesz użyć DataframeSource(). Ramka danych przekazywana do DataframeSource() musi mieć określoną strukturę:
- Kolumna pierwsza musi nazywać się
doc_idi zawierać unikalny ciąg znaków dla każdego wiersza. - Kolumna druga musi nazywać się
texti mieć kodowanie „UTF-8" (standard). - Wszystkie pozostałe kolumny, od 3. wzwyż, są traktowane jako metadane i zostają zachowane.
To ćwiczenie wprowadza funkcję meta(), która służy do wyodrębniania metadanych powiązanych z każdym dokumentem. Dane często zawierają metadane takie jak autorzy, daty, tagi tematyczne czy miejsca – mogą one wzbogacić analizę. Po przekształceniu tekstu na korpus możesz użyć meta(), aby sprawdzić dodatkowe informacje na poziomie dokumentu.
To ćwiczenie jest częścią kursu
Eksploracja tekstu metodą Bag-of-Words w R
Instrukcje do ćwiczenia
W obszarze roboczym znajdziesz prostą ramkę danych o nazwie example_text z odpowiednimi nazwami kolumn i pewnymi metadanymi. Dostępny jest również vec_corpus – korpus ulotny (volatile corpus) utworzony za pomocą VectorSource().
- Utwórz
df_source, używającDataframeSource()zexample_text. - Utwórz
df_corpus, konwertującdf_sourcena ulotny obiekt korpusu za pomocąVCorpus(). - Wyświetl
df_corpus. Zwróć uwagę na liczbę dokumentów oraz liczbę zachowanych metadanych na poziomie dokumentu. - Użyj
meta()nadf_corpus, aby wyświetlić metadane powiązane z dokumentami. - Przejrzyj wstępnie załadowany obiekt
vec_corpus. Porównaj liczbę dokumentów zdf_corpus. - Użyj
meta()navec_corpus, aby porównać metadane dostępne wvec_corpusidf_corpus.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create a DataframeSource from the example text
df_source <- ___
# Convert df_source to a volatile corpus
df_corpus <- ___
# Examine df_corpus
df_corpus
# Examine df_corpus metadata
___
# Compare the number of documents in the vector source
vec_corpus
# Compare metadata in the vector corpus
___