ÎncepețiÎncepe gratuit

Încarcă niște text

Text mining-ul începe prin încărcarea unor date text în R, pe care o vom face cu funcția read.csv().

O bună practică este să examinezi obiectul citit pentru a ști care coloană (sau coloane) este importantă. Funcția str() oferă o modalitate eficientă de a face acest lucru.

Dacă cadrul de date conține coloane care nu sunt text, poate fi util să creezi un obiect nou folosind doar coloana de text potrivită (de exemplu, some_object$column_name).

Reține că acestea sunt date reale de pe Twitter, prin urmare există întotdeauna riscul ca acestea să conțină limbaj vulgar sau alt conținut ofensator (în acest exercițiu și în orice exerciții ulterioare care folosesc tot date reale de pe Twitter).

Acest exercițiu face parte din cursul

Text Mining cu Bag-of-Words în R

Vezi cursul

Instrucțiuni pentru exercițiu

Datele au fost deja încărcate pentru tine și sunt disponibile în coffee_data_file.

  • Creează un obiect nou tweets folosind read.csv() pe fișierul coffee_data_file, care conține tweet-uri ce menționează cafeaua.
  • Examinează obiectul tweets cu str() pentru a determina care coloană conține textul pe care vrei să îl analizezi.
  • Creează un obiect nou coffee_tweets folosind doar coloana de text identificată anterior. Pentru aceasta, folosește operatorul $ și numele coloanei.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import text data from CSV, no factors
tweets <- ___

# View the structure of tweets
___

# Isolate text from tweets
coffee_tweets <- ___
Editează și rulează codul