BOW na základě recenzí produktů
Vyzkoušel/a sis BOW na malém datasetu. Teď ho aplikuješ na vzorek recenzí produktů z Amazonu. Data jsou už načtena v proměnné reviews a obsahují dva sloupce. První se jmenuje score – nabývá hodnoty 0 pro negativní recenzi a 1 pro pozitivní. Druhý sloupec se jmenuje review a obsahuje text recenze, kterou zákazník napsal. Klidně si data prozkoumej v IPython Shellu.
Tvým úkolem je sestavit BOW slovník z hodnot ve sloupci review.
Nezapomeň, že na vektorizátoru můžeš zavolat metodu .get_feature_names(), která vrátí seznam všech prvků slovníku.
Toto cvičení je součástí kurzu
Sentiment Analysis v Pythonu
Pokyny k cvičení
- Vytvoř objekt CountVectorizer a zadej maximální počet příznaků.
- Přizpůsob vektorizátor datům.
- Transformuj přizpůsobený vektorizátor.
- Vytvoř DataFrame, ve kterém převedeš řídkou matici na husté pole, a nezapomeň správně pojmenovat sloupce.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
from sklearn.feature_extraction.text import CountVectorizer
# Build the vectorizer, specify max features
vect = ____(____=100)
# Fit the vectorizer
vect.____(reviews.review)
# Transform the review column
X_review = vect.____(reviews.review)
# Create the bow representation
X_df=pd.DataFrame(X_review._____, columns=___.____)
print(X_df.head())