Analiza częstości słów
Gratulacje! Właśnie dołączyłeś do PyBooks. PyBooks tworzy system rekomendacji książek i chce wykrywać wzorce oraz trendy w tekstach, aby poprawiać jakość rekomendacji.
Na początek warto poznać częstość występowania słów w danym tekście i usunąć te rzadkie.
Pamiętaj, że typowe zbiory danych w rzeczywistych projektach będą większe niż ten przykład.
To ćwiczenie jest częścią kursu
Uczenie głębokie dla tekstu z PyTorch
Instrukcje do ćwiczenia
- Zaimportuj
get_tokenizerz bibliotekitorchtextorazFreqDistz bibliotekinltk. - Zainicjalizuj tokenizer dla języka angielskiego i przeprowadź tokenizację podanego tekstu
text. - Oblicz rozkład częstości dla
tokensi usuń rzadkie słowa, korzystając z wyrażenia listowego.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import the necessary functions
from torchtext.data.utils import ____
from nltk.probability import ____
text = "In the city of Dataville, a data analyst named Alex explores hidden insights within vast data. With determination, Alex uncovers patterns, cleanses the data, and unlocks innovation. Join this adventure to unleash the power of data-driven decisions."
# Initialize the tokenizer and tokenize the text
tokenizer = ____("basic_english")
tokens = tokenizer(____)
threshold = 1
# Remove rare words and print common tokens
freq_dist = ____(____)
common_tokens = [token for token in tokens if ____[token] > ____]
print(common_tokens)