Mai multe coloane de text
În acest exercițiu, vei continua să lucrezi cu datele de pe Twitter despre companii aeriene. Un set de date tweets a fost deja importat pentru tine.
Uneori, un set de date poate conține mai mult de o coloană de text și poate că vrei să creezi o reprezentare numerică pentru fiecare dintre ele. Pe lângă coloana text, care conține corpul tweet-ului, există o a doua coloană de text, numită negativereason. Aceasta conține motivul pentru care clientul a lăsat o recenzie negativă.
Sarcina ta este să construiești reprezentări BOW pentru ambele coloane și să specifici cuvintele de ignorat necesare.
Acest exercițiu face parte din cursul
Analiza sentimentelor în Python
Instrucțiuni pentru exercițiu
- Importă pachetul vectorizatorului și lista implicită de cuvinte de ignorat în limba engleză.
- Actualizează lista implicită de cuvinte de ignorat în limba engleză și creează mulțimea
my_stop_words. - Specifică argumentul pentru cuvintele de ignorat în primul vectorizator ca fiind mulțimea actualizată, iar în al doilea vectorizator – lista implicită de cuvinte de ignorat în limba engleză.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import the vectorizer and default English stop words list
____
# Define the stop words
my_stop_words = ____._____(['airline', 'airlines', '@', 'am', 'pm'])
# Build and fit the vectorizers
vect1 = CountVectorizer(____=my_stop_words)
vect2 = CountVectorizer(____=____)
vect1.fit(tweets.text)
vect2.fit(tweets.negative_reason)
# Print the last 15 features from the first, and all from second vectorizer
print(vect1.get_feature_names()[-15:])
print(vect2.get_feature_names())