ÎncepețiÎncepe gratuit

Capturarea metadatelor în tm

În funcție de ce vrei să realizezi, s-ar putea să dorești să păstrezi metadatele despre document atunci când creezi un corpus.

Pentru a captura metadatele la nivel de document, numele coloanelor și ordinea acestora trebuie să fie:

  1. doc_id - un șir unic pentru fiecare document
  2. text - textul de analizat
  3. ... - orice alte coloane vor fi catalogate automat ca metadate.

Uneori va trebui să redenumești coloanele pentru a respecta cerințele funcției DataframeSource(). Funcția names() este utilă în acest sens.

tweets există în spațiul tău de lucru ca un data frame cu coloanele „num", „text", „screenName" și „created".

Acest exercițiu face parte din cursul

Text Mining cu Bag-of-Words în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Redenumește prima coloană a lui tweets cu „doc_id".
  • Definește schema documentului folosind DataframeSource() pe data frame-ul tweets.
  • Transformă colecția de documente într-un corpus volatil îmbicat în funcția personalizată clean_corpus().
  • Aplică content() pentru primul tweet folosind paranteze duble, precum text_corpus[[1]], pentru a vedea textul simplu curățat.
  • Confirmă că toate metadatele au fost capturate folosind funcția meta() pe primul document cu paranteze simple.

Reține că, atunci când accesezi o parte dintr-un corpus, parantezele duble sau simple fac diferența! În acest exercițiu, vei folosi paranteze duble cu content() și paranteze simple cu meta().

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Rename columns
___(tweets)[1] <- "___"

# Set the schema: docs
docs <- ___(___)

# Make a clean volatile corpus: text_corpus
text_corpus <- clean_corpus(___(___))

# Examine the first doc content
___(text_corpus[[___]])

# Access the first doc metadata
___(text_corpus[___])
Editează și rulează codul