Modelul BoW pentru tagline-uri de filme
În acest exercițiu, ai la dispoziție un corpus cu mai mult de 7.000 de tagline-uri de filme. Sarcina ta este să generezi reprezentarea bag of words bow_matrix pentru aceste tagline-uri. În acest exercițiu, vom omite etapa de preprocesare a textului și vom genera bow_matrix direct.
Vom analiza și forma matricei bow_matrix obținute. Primele cinci tagline-uri din corpus au fost afișate în consolă pentru a le putea examina.
Acest exercițiu face parte din cursul
Ingineria caracteristicilor pentru NLP în Python
Instrucțiuni pentru exercițiu
- Importă clasa
CountVectorizerdinsklearn. - Instanțiază un obiect
CountVectorizer. Numește-lvectorizer. - Folosind
fit_transform(), genereazăbow_matrixpentrucorpus.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create CountVectorizer object
____ = ____
# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)
# Print the shape of bow_matrix
print(bow_matrix.shape)