Sac de mots pour les titres de livres
PyBooks a maintenant une liste de titres de livres qui doivent être encodés pour une analyse ultérieure. L'équipe des données croit que le modèle Bag of Words (BoW) pourrait être la meilleure approche.
Les modules suivants ont été importés pour vous : torch, torchtext.
Cette activité fait partie du cours
Apprentissage profond pour le texte avec PyTorch
Instructions de l’exercice
- Importez la classe
CountVectorizerpour mettre en œuvre le sac de mots (bag-of-words). - Initialisez un objet de la classe importée, puis utilisez cet objet pour transformer
titlesen une représentation matricielle. - Extrayez et affichez les cinq premiers noms de caractéristiques et les titres encodés avec la méthode
get_feature_names_out().
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import from sklearn
from sklearn.feature_extraction.text import ____
titles = ['The Great Gatsby','To Kill a Mockingbird','1984','The Catcher in the Rye','The Hobbit', 'Great Expectations']
# Initialize Bag-of-words with the list of book titles
vectorizer = ____()
bow_encoded_titles = ____.fit_transform(____)
# Extract and print the first five features
print(vectorizer.____[:5])
print(bow_encoded_titles.toarray()[0, :5])