ÎncepețiÎncepe gratuit

Crearea unui corpus

Ai creat un tibble numit russian_tweets care conține aproximativ 20.000 de tweet-uri generate automat de boți în perioada alegerilor din SUA din 2016, pentru a putea efectua analiză de text. După ce ai explorat opțiunile disponibile, ai ales pachetul tm ca cea mai convenabilă soluție. Pentru a putea realiza analiza, trebuie mai întâi să creezi un corpus și să îi atașezi metadate potențial utile.

Reține că acestea sunt date reale de pe Twitter și, prin urmare, există întotdeauna riscul ca ele să conțină limbaj vulgar sau alt conținut ofensator (în acest exercițiu și în orice exerciții ulterioare care folosesc, de asemenea, date reale de pe Twitter).

Acest exercițiu face parte din cursul

Introducere în Prelucrarea Limbajului Natural în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează un corpus folosind coloana content din russian_tweets.
  • Atașează coloanele following și followers ca metadate la tweet_corpus.
  • Afișează primele rânduri din tabelul de metadate.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create a corpus
tweet_corpus <- ___(___(russian_tweets$___))

# Attach following and followers
___(tweet_corpus, 'following') <- russian_tweets$___
___(tweet_corpus, 'followers') <- russian_tweets$___

# Review the meta data
head(meta(___))
Editează și rulează codul