Zacznij terazZacznij za darmo

Tworzenie korpusu

Masz do dyspozycji obiekt typu tibble o nazwie russian_tweets, zawierający około 20 000 tweetów wygenerowanych automatycznie przez boty podczas kampanii wyborczej w USA w 2016 roku. Chcesz przeprowadzić analizę tekstu i po zapoznaniu się z dostępnymi opcjami dochodzisz do wniosku, że pakiet tm oferuje najbardziej przystępne rozwiązanie. Zanim jednak przystąpisz do analizy, musisz utworzyć korpus i dołączyć do niego potencjalnie przydatne metadane.

Pamiętaj, że są to prawdziwe dane z Twittera – istnieje więc ryzyko, że mogą zawierać wulgaryzmy lub inne treści uznawane za obraźliwe (dotyczy to tego ćwiczenia oraz kolejnych ćwiczeń korzystających z rzeczywistych danych z Twittera).

To ćwiczenie jest częścią kursu

Wprowadzenie do przetwarzania języka naturalnego w R

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz korpus, korzystając z kolumny content obiektu russian_tweets.
  • Dołącz kolumny following i followers jako metadane do obiektu tweet_corpus.
  • Wyświetl pierwsze wiersze tabeli metadanych.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Create a corpus
tweet_corpus <- ___(___(russian_tweets$___))

# Attach following and followers
___(tweet_corpus, 'following') <- russian_tweets$___
___(tweet_corpus, 'followers') <- russian_tweets$___

# Review the meta data
head(meta(___))
Edytuj i uruchom kod