Zacznij terazZacznij za darmo

Model Bag-of-Words dla tytułów książek

PyBooks posiada teraz listę tytułów książek, które trzeba zakodować do dalszej analizy. Zespół ds. danych uważa, że model Bag of Words (BoW) będzie najlepszym podejściem.

Następujące pakiety zostały już zaimportowane: torch, torchtext.

To ćwiczenie jest częścią kursu

Uczenie głębokie dla tekstu z PyTorch

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj klasę CountVectorizer do implementacji modelu bag-of-words.
  • Zainicjalizuj obiekt zaimportowanej klasy, a następnie użyj go do przekształcenia listy titles w reprezentację macierzową.
  • Wyodrębnij i wyświetl pięć pierwszych nazw cech oraz zakodowane tytuły, korzystając z metody get_feature_names_out().

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import from sklearn
from sklearn.feature_extraction.text import ____

titles = ['The Great Gatsby','To Kill a Mockingbird','1984','The Catcher in the Rye','The Hobbit', 'Great Expectations']

# Initialize Bag-of-words with the list of book titles
vectorizer = ____()
bow_encoded_titles = ____.fit_transform(____)

# Extract and print the first five features
print(vectorizer.____[:5])
print(bow_encoded_titles.toarray()[0, :5])
Edytuj i uruchom kod