CommencezCommencez gratuitement

Sac de mots pour les titres de livres

PyBooks a maintenant une liste de titres de livres qui doivent être encodés pour une analyse ultérieure. L'équipe des données croit que le modèle Bag of Words (BoW) pourrait être la meilleure approche.

Les modules suivants ont été importés pour vous : torch, torchtext.

Cette activité fait partie du cours

Apprentissage profond pour le texte avec PyTorch

Voir le cours

Instructions de l’exercice

  • Importez la classe CountVectorizer pour mettre en œuvre le sac de mots (bag-of-words).
  • Initialisez un objet de la classe importée, puis utilisez cet objet pour transformer titles en une représentation matricielle.
  • Extrayez et affichez les cinq premiers noms de caractéristiques et les titres encodés avec la méthode get_feature_names_out().

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import from sklearn
from sklearn.feature_extraction.text import ____

titles = ['The Great Gatsby','To Kill a Mockingbird','1984','The Catcher in the Rye','The Hobbit', 'Great Expectations']

# Initialize Bag-of-words with the list of book titles
vectorizer = ____()
bow_encoded_titles = ____.fit_transform(____)

# Extract and print the first five features
print(vectorizer.____[:5])
print(bow_encoded_titles.toarray()[0, :5])
Modifier et exécuter le code