Model Bag-of-Words dla tytułów książek
PyBooks posiada teraz listę tytułów książek, które trzeba zakodować do dalszej analizy. Zespół ds. danych uważa, że model Bag of Words (BoW) będzie najlepszym podejściem.
Następujące pakiety zostały już zaimportowane: torch, torchtext.
To ćwiczenie jest częścią kursu
Uczenie głębokie dla tekstu z PyTorch
Instrukcje do ćwiczenia
- Zaimportuj klasę
CountVectorizerdo implementacji modelu bag-of-words. - Zainicjalizuj obiekt zaimportowanej klasy, a następnie użyj go do przekształcenia listy
titlesw reprezentację macierzową. - Wyodrębnij i wyświetl pięć pierwszych nazw cech oraz zakodowane tytuły, korzystając z metody
get_feature_names_out().
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import from sklearn
from sklearn.feature_extraction.text import ____
titles = ['The Great Gatsby','To Kill a Mockingbird','1984','The Catcher in the Rye','The Hobbit', 'Great Expectations']
# Initialize Bag-of-words with the list of book titles
vectorizer = ____()
bow_encoded_titles = ____.fit_transform(____)
# Extract and print the first five features
print(vectorizer.____[:5])
print(bow_encoded_titles.toarray()[0, :5])