Zacznij terazZacznij za darmo

Analiza częstości słów

Gratulacje! Właśnie dołączyłeś do PyBooks. PyBooks tworzy system rekomendacji książek i chce wykrywać wzorce oraz trendy w tekstach, aby poprawiać jakość rekomendacji.

Na początek warto poznać częstość występowania słów w danym tekście i usunąć te rzadkie.

Pamiętaj, że typowe zbiory danych w rzeczywistych projektach będą większe niż ten przykład.

To ćwiczenie jest częścią kursu

Uczenie głębokie dla tekstu z PyTorch

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj get_tokenizer z biblioteki torchtext oraz FreqDist z biblioteki nltk.
  • Zainicjalizuj tokenizer dla języka angielskiego i przeprowadź tokenizację podanego tekstu text.
  • Oblicz rozkład częstości dla tokens i usuń rzadkie słowa, korzystając z wyrażenia listowego.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import the necessary functions
from torchtext.data.utils import ____
from nltk.probability import ____

text = "In the city of Dataville, a data analyst named Alex explores hidden insights within vast data. With determination, Alex uncovers patterns, cleanses the data, and unlocks innovation. Join this adventure to unleash the power of data-driven decisions."

# Initialize the tokenizer and tokenize the text
tokenizer = ____("basic_english")
tokens = tokenizer(____)

threshold = 1
# Remove rare words and print common tokens
freq_dist = ____(____)
common_tokens = [token for token in tokens if ____[token] > ____]
print(common_tokens)
Edytuj i uruchom kod