Začněte nyníZačněte zdarma

Vytvoření tibble z korpusu

Aby ses mohl/a hlouběji ponořit do korpusu s daty o ropě, který ti poskytl kolega, rozhodl/a ses sestavit pipeline pro čištění textu obsaženého v dokumentech. Místo toho, abys to řešil/a přes balíček tm, se rozhodneš korpus převést na tibble – a využít funkce unnest_tokens(), count() a anti_join(), které už dobře znáš. Korpus crude obsahuje jak metadata, tak samotný text každého dokumentu.

Toto cvičení je součástí kurzu

Úvod do zpracování přirozeného jazyka v R

Zobrazit kurz

Pokyny k cvičení

  • Převeď korpus na tibble.
  • Pomocí names vypiš názvy sloupců.
  • Tokenizuj sloupec text z crude_tibble (po slovech), spočítej tokeny a odstraň stop slova.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create a tibble & Review
crude_tibble <- ___(crude)
___(crude_tibble)

crude_counts <- crude_tibble %>%
  # Tokenize by word 
  ___(___, text) %>%
  # Count by word
  ___(word, sort = TRUE) %>%
  # Remove stop words
  ___(stop_words)
Upravit a spustit kód