ÎncepețiÎncepe gratuit

Crearea unui tibble dintr-un corpus

Pentru a explora mai în detaliu corpusul despre date privind petrolul brut primit de la un coleg, ai decis să creezi un pipeline care să curețe textul din documente. În loc să folosești pachetul tm, ai ales să transformi corpusul într-un tibble, astfel încât să poți utiliza funcțiile unnest_tokens(), count() și anti_join() cu care ești deja familiarizat. Corpusul crude conține atât metadatele, cât și textul fiecărui document.

Acest exercițiu face parte din cursul

Introducere în Prelucrarea Limbajului Natural în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Convertește corpusul într-un tibble.
  • Folosește names pentru a afișa numele coloanelor.
  • Tokenizează (după cuvânt), numără și elimină cuvintele de stop din coloana text a obiectului crude_tibble.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create a tibble & Review
crude_tibble <- ___(crude)
___(crude_tibble)

crude_counts <- crude_tibble %>%
  # Tokenize by word 
  ___(___, text) %>%
  # Count by word
  ___(word, sort = TRUE) %>%
  # Remove stop words
  ___(stop_words)
Editează și rulează codul