Tworzenie korpusu
Masz do dyspozycji obiekt typu tibble o nazwie russian_tweets, zawierający około 20 000 tweetów wygenerowanych automatycznie przez boty podczas kampanii wyborczej w USA w 2016 roku. Chcesz przeprowadzić analizę tekstu i po zapoznaniu się z dostępnymi opcjami dochodzisz do wniosku, że pakiet tm oferuje najbardziej przystępne rozwiązanie. Zanim jednak przystąpisz do analizy, musisz utworzyć korpus i dołączyć do niego potencjalnie przydatne metadane.
Pamiętaj, że są to prawdziwe dane z Twittera – istnieje więc ryzyko, że mogą zawierać wulgaryzmy lub inne treści uznawane za obraźliwe (dotyczy to tego ćwiczenia oraz kolejnych ćwiczeń korzystających z rzeczywistych danych z Twittera).
To ćwiczenie jest częścią kursu
Wprowadzenie do przetwarzania języka naturalnego w R
Instrukcje do ćwiczenia
- Utwórz korpus, korzystając z kolumny
contentobiekturussian_tweets. - Dołącz kolumny
followingifollowersjako metadane do obiektutweet_corpus. - Wyświetl pierwsze wiersze tabeli metadanych.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create a corpus
tweet_corpus <- ___(___(russian_tweets$___))
# Attach following and followers
___(tweet_corpus, 'following') <- russian_tweets$___
___(tweet_corpus, 'followers') <- russian_tweets$___
# Review the meta data
head(meta(___))