Vytvoření tibble z korpusu
Aby ses mohl/a hlouběji ponořit do korpusu s daty o ropě, který ti poskytl kolega, rozhodl/a ses sestavit pipeline pro čištění textu obsaženého v dokumentech. Místo toho, abys to řešil/a přes balíček tm, se rozhodneš korpus převést na tibble – a využít funkce unnest_tokens(), count() a anti_join(), které už dobře znáš. Korpus crude obsahuje jak metadata, tak samotný text každého dokumentu.
Toto cvičení je součástí kurzu
Úvod do zpracování přirozeného jazyka v R
Pokyny k cvičení
- Převeď korpus na tibble.
- Pomocí
namesvypiš názvy sloupců. - Tokenizuj sloupec
textzcrude_tibble(po slovech), spočítej tokeny a odstraň stop slova.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create a tibble & Review
crude_tibble <- ___(crude)
___(crude_tibble)
crude_counts <- crude_tibble %>%
# Tokenize by word
___(___, text) %>%
# Count by word
___(word, sort = TRUE) %>%
# Remove stop words
___(stop_words)