Začněte nyníZačněte zdarma

Použití TF-IDF na popisy knih

PyBooks shromáždil několik popisů knih a chce v nich identifikovat důležitá slova pomocí techniky kódování TF-IDF. Díky tomu doufají, že lépe porozumí jedinečným vlastnostem každé knihy a zlepší svůj systém doporučování knih.

Následující balíčky už jsou za tebe naimportovány: torch, torchtext.

Toto cvičení je součástí kurzu

Deep Learning for Text with PyTorch

Zobrazit kurz

Pokyny k cvičení

  • Importuj třídu TfidfVectorizer z sklearn.feature_extraction.text, která převádí kolekci surových dokumentů na matici TF-IDF příznaků.
  • Vytvoř instanci této třídy a pomocí ní zakóduj descriptions do TF-IDF matice vektorů.
  • Načti a zobraz prvních pět názvů příznaků z vectorizer a zakódovaných vektorů z tfidf_encoded_descriptions.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Importing TF-IDF from sklearn
from sklearn.feature_extraction.text import ____

# Initialize TF-IDF encoding vectorizer
vectorizer = ____()
tfidf_encoded_descriptions = vectorizer.____(descriptions)

# Extract and print the first five features
print(____.get_feature_names_out()[:5])
print(____.toarray()[0, :5])
Upravit a spustit kód