ÎncepețiÎncepe gratuit

Analiza dimensionalității și preprocesarea

În acest exercițiu, ai la dispoziție un corpus lem_corpus care conține versiunile preprocesate ale sloganurilor de film din exercițiul anterior. Cu alte cuvinte, sloganurile au fost convertite la litere mici, lemmatizate și curățate de cuvintele de stop.

Sarcina ta este să generezi reprezentarea bag of words bow_lem_matrix pentru aceste sloganuri lemmatizate și să îi compari forma cu cea a matricei bow_matrix obținute în exercițiul anterior. Primele cinci sloganuri lemmatizate din lem_corpus au fost afișate în consolă pentru a le putea examina.

Acest exercițiu face parte din cursul

Ingineria caracteristicilor pentru NLP în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă clasa CountVectorizer din sklearn.
  • Instanțiază un obiect CountVectorizer. Numește-l vectorizer.
  • Folosind fit_transform(), generează bow_lem_matrix pentru lem_corpus.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create CountVectorizer object
____ = ____

# Generate matrix of word vectors
bow_lem_matrix = ____.____(lem_corpus)

# Print the shape of bow_lem_matrix
print(bow_lem_matrix.shape)
Editează și rulează codul