Мешок слов с n-граммами и ограничением словаря
В этом упражнении вы снова попрактикуетесь в построении мешка слов — на этот раз с использованием набора данных reviews с отзывами о товарах Amazon. Ваша основная задача — ограничить размер словаря и задать длину последовательности токенов.
Это упражнение является частью курса
Анализ тональности текста на Python
Инструкции к упражнению
- Импортируйте векторизатор из библиотеки
sklearn. - Создайте векторизатор со следующими параметрами: размер словаря не должен превышать 1000, используйте только биграммы, игнорируйте термины, встречающиеся более чем в 500 документах.
- Примените векторизатор к столбцу
review. - Создайте DataFrame на основе представления в виде мешка слов.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
#Import the vectorizer
from sklearn.____.____ import ____
# Build the vectorizer, specify max features and fit
vect = ____(____=1000, ____=(2, 2), ____=500)
vect.____(reviews.review)
# Transform the review
X_review = vect.transform(reviews.review)
# Create a DataFrame from the bow representation
X_df = pd.DataFrame(X_review.____, columns=____._____)
print(X_df.head())