Zacznij terazZacznij za darmo

Model BoW dla tagline'ów filmowych

W tym ćwiczeniu masz do dyspozycji corpus zawierający ponad 7000 tagline'ów filmowych. Twoim zadaniem jest wygenerowanie reprezentacji bag of words — bow_matrix — dla tych tagline'ów. Na tym etapie pomijamy krok wstępnego przetwarzania tekstu i generujemy bow_matrix bezpośrednio.

Sprawdzimy też kształt wynikowej macierzy bow_matrix. Pierwsze pięć tagline'ów z corpus zostało wyświetlonych w konsoli — możesz je przejrzeć.

To ćwiczenie jest częścią kursu

Inżynieria cech dla NLP w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj klasę CountVectorizer z biblioteki sklearn.
  • Utwórz obiekt CountVectorizer i nadaj mu nazwę vectorizer.
  • Korzystając z fit_transform(), wygeneruj bow_matrix dla corpus.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create CountVectorizer object
____ = ____

# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)

# Print the shape of bow_matrix
print(bow_matrix.shape)
Edytuj i uruchom kod