TF-IDF представление отзывов о продуктах
Вы работаете с командой поддержки клиентов в компании, выпускающей устройства для умного дома. Команда собрала отзывы пользователей о различных устройствах и хочет определить, какие слова выделяются в каждом отзыве. Вы предлагаете использовать метод TF-IDF, чтобы выявить наиболее значимые термины в отзывах. Давайте поможем им приступить к работе!
Функция preprocess(), которая принимает текст и возвращает обработанную версию, уже загружена. Эта функция выполняет приведение к нижнему регистру, токенизацию и удаление знаков пунктуации. Библиотека Pandas импортирована как pd, а класс TfidfVectorizer готов к использованию.
Это упражнение является частью курса
Обработка естественного языка (NLP) на Python
Инструкции к упражнению
- Инициализируйте TF-IDF
vectorizer. - Преобразуйте очищенные отзывы в
tfidf_matrix. - Создайте DataFrame
dfдляtfidf_matrix, используя слова из словаря в качестве столбцов.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
reviews = ["The smart speaker is incredible. Clear sound and fast responses!",
"I am disappointed with the smart bulb. It stopped working in a week.",
"The thermostat is okay. Not too smart, but functional."]
cleaned_reviews = [preprocess(review) for review in reviews]
# Initialize the vectorizer
vectorizer = ____
# Transform the cleaned reviews
tfidf_matrix = ____
# Create a DataFrame for TF-IDF
df = pd.DataFrame(
tfidf_matrix.toarray(),
columns=vectorizer.____
)
print(df.head())