Comece agoraComece grátis

Usando n-grams mais longos

Até agora, você criou variáveis com base em palavras individuais de cada texto. Isso pode ser bem poderoso em um modelo de Machine Learning, mas talvez você se preocupe que, ao olhar as palavras isoladamente, muito do contexto seja perdido. Para lidar com isso na criação de modelos, você pode usar n-grams, que são sequências de n palavras agrupadas. Por exemplo:

  • bigramas: Sequências de duas palavras consecutivas
  • trigramas: Sequências de três palavras consecutivas

Você pode criá-los automaticamente no seu conjunto de dados especificando o argumento ngram_range como uma tupla (n1, n2), em que todos os n-grams no intervalo de n1 a n2 são incluídos.

Este exercicio faz parte do curso

Feature Engineering for Machine Learning in Python

Ver curso

Instruções do exercicio

  • Importe CountVectorizer de sklearn.feature_extraction.text.
  • Instancie CountVectorizer considerando apenas trigramas.
  • Faça o ajuste do vetorizador e aplique-o à coluna text_clean em um único passo.
  • Imprima os nomes das variáveis geradas pelo vetorizador.

exercicio interativo prático

Tente este exercicio completando este código de exemplo.

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Instantiate a trigram vectorizer
cv_trigram_vec = CountVectorizer(max_features=100, 
                                 stop_words='english', 
                                 ____)

# Fit and apply trigram vectorizer
cv_trigram = ____(speech_df['text_clean'])

# Print the trigram features
print(cv_trigram_vec.____)
Editar e Executar Código