Încarcă niște text
Text mining-ul începe prin încărcarea unor date text în R, pe care o vom face cu funcția read.csv().
O bună practică este să examinezi obiectul citit pentru a ști care coloană (sau coloane) este importantă. Funcția str() oferă o modalitate eficientă de a face acest lucru.
Dacă cadrul de date conține coloane care nu sunt text, poate fi util să creezi un obiect nou folosind doar coloana de text potrivită (de exemplu, some_object$column_name).
Reține că acestea sunt date reale de pe Twitter, prin urmare există întotdeauna riscul ca acestea să conțină limbaj vulgar sau alt conținut ofensator (în acest exercițiu și în orice exerciții ulterioare care folosesc tot date reale de pe Twitter).
Acest exercițiu face parte din cursul
Text Mining cu Bag-of-Words în R
Instrucțiuni pentru exercițiu
Datele au fost deja încărcate pentru tine și sunt disponibile în coffee_data_file.
- Creează un obiect nou
tweetsfolosindread.csv()pe fișierulcoffee_data_file, care conține tweet-uri ce menționează cafeaua. - Examinează obiectul
tweetscustr()pentru a determina care coloană conține textul pe care vrei să îl analizezi. - Creează un obiect nou
coffee_tweetsfolosind doar coloana de text identificată anterior. Pentru aceasta, folosește operatorul$și numele coloanei.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import text data from CSV, no factors
tweets <- ___
# View the structure of tweets
___
# Isolate text from tweets
coffee_tweets <- ___