Analiza dimensionalității și preprocesarea
În acest exercițiu, ai la dispoziție un corpus lem_corpus care conține versiunile preprocesate ale sloganurilor de film din exercițiul anterior. Cu alte cuvinte, sloganurile au fost convertite la litere mici, lemmatizate și curățate de cuvintele de stop.
Sarcina ta este să generezi reprezentarea bag of words bow_lem_matrix pentru aceste sloganuri lemmatizate și să îi compari forma cu cea a matricei bow_matrix obținute în exercițiul anterior. Primele cinci sloganuri lemmatizate din lem_corpus au fost afișate în consolă pentru a le putea examina.
Acest exercițiu face parte din cursul
Ingineria caracteristicilor pentru NLP în Python
Instrucțiuni pentru exercițiu
- Importă clasa
CountVectorizerdinsklearn. - Instanțiază un obiect
CountVectorizer. Numește-lvectorizer. - Folosind
fit_transform(), genereazăbow_lem_matrixpentrulem_corpus.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create CountVectorizer object
____ = ____
# Generate matrix of word vectors
bow_lem_matrix = ____.____(lem_corpus)
# Print the shape of bow_lem_matrix
print(bow_lem_matrix.shape)