Capturarea metadatelor în tm
În funcție de ce vrei să realizezi, s-ar putea să dorești să păstrezi metadatele despre document atunci când creezi un corpus.
Pentru a captura metadatele la nivel de document, numele coloanelor și ordinea acestora trebuie să fie:
doc_id- un șir unic pentru fiecare documenttext- textul de analizat...- orice alte coloane vor fi catalogate automat ca metadate.
Uneori va trebui să redenumești coloanele pentru a respecta cerințele funcției DataframeSource(). Funcția names() este utilă în acest sens.
tweets există în spațiul tău de lucru ca un data frame cu coloanele „num", „text", „screenName" și „created".
Acest exercițiu face parte din cursul
Text Mining cu Bag-of-Words în R
Instrucțiuni pentru exercițiu
- Redenumește prima coloană a lui
tweetscu „doc_id". - Definește schema documentului folosind
DataframeSource()pe data frame-ultweets. - Transformă colecția de documente într-un corpus volatil îmbicat în funcția personalizată
clean_corpus(). - Aplică
content()pentru primul tweet folosind paranteze duble, precumtext_corpus[[1]], pentru a vedea textul simplu curățat. - Confirmă că toate metadatele au fost capturate folosind funcția
meta()pe primul document cu paranteze simple.
Reține că, atunci când accesezi o parte dintr-un corpus, parantezele duble sau simple fac diferența! În acest exercițiu, vei folosi paranteze duble cu content() și paranteze simple cu meta().
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Rename columns
___(tweets)[1] <- "___"
# Set the schema: docs
docs <- ___(___)
# Make a clean volatile corpus: text_corpus
text_corpus <- clean_corpus(___(___))
# Examine the first doc content
___(text_corpus[[___]])
# Access the first doc metadata
___(text_corpus[___])