Матрица косинусного сходства для корпуса текстов
В этом упражнении вам предоставлен corpus — список из пяти предложений. Содержимое corpus выведено в консоли. Вам нужно вычислить матрицу косинусного сходства, которая содержит попарные оценки косинусного сходства для каждой пары предложений (векторизованных с помощью tf-idf).
Напомним: значение в i-й строке и j-м столбце матрицы сходства соответствует оценке сходства для i-го и j-го векторов.
Это упражнение является частью курса
Конструирование признаков для NLP на Python
Инструкции к упражнению
- Создайте экземпляр
TfidfVectorizerи назовите егоtfidf_vectorizer. - С помощью метода
fit_transform()получите tf-idf векторы дляcorpusи назовите результатtfidf_matrix. - Используйте
cosine_similarity(), передавtfidf_matrix, чтобы вычислить матрицу косинусного сходстваcosine_sim.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Initialize an instance of tf-idf Vectorizer
tfidf_vectorizer = ____
# Generate the tf-idf vectors for the corpus
tfidf_matrix = tfidf_vectorizer.fit_transform(____)
# Compute and print the cosine similarity matrix
cosine_sim = ____(____, tfidf_matrix)
print(cosine_sim)