Tokenizacja: zdania
„Folwark zwierzęcy" to popularna lektura często zadawana uczniom szkół średnich. Postanowiłeś(-aś) przeprowadzić analizę tego tekstu i przygotować podstawowe statystyki, które mogą pomóc nauczycielom przy przydzielaniu tej książki uczniom. Wiesz już, że książka ma 10 rozdziałów, a tokenizacja pozwoli ci policzyć zdania, słowa, a nawet akapity. W tym ćwiczeniu skorzystasz z technik tokenizacji poznanych w filmie, aby podzielić „Folwark zwierzęcy" na zdania i zliczyć je według rozdziałów.
To ćwiczenie jest częścią kursu
Wprowadzenie do przetwarzania języka naturalnego w R
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Split the text_column into sentences
animal_farm %>%
___(output = "sentences", input = text_column, token = ___)