ÎncepețiÎncepe gratuit

Modelul BoW pentru tagline-uri de filme

În acest exercițiu, ai la dispoziție un corpus cu mai mult de 7.000 de tagline-uri de filme. Sarcina ta este să generezi reprezentarea bag of words bow_matrix pentru aceste tagline-uri. În acest exercițiu, vom omite etapa de preprocesare a textului și vom genera bow_matrix direct.

Vom analiza și forma matricei bow_matrix obținute. Primele cinci tagline-uri din corpus au fost afișate în consolă pentru a le putea examina.

Acest exercițiu face parte din cursul

Ingineria caracteristicilor pentru NLP în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă clasa CountVectorizer din sklearn.
  • Instanțiază un obiect CountVectorizer. Numește-l vectorizer.
  • Folosind fit_transform(), generează bow_matrix pentru corpus.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create CountVectorizer object
____ = ____

# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)

# Print the shape of bow_matrix
print(bow_matrix.shape)
Editează și rulează codul