НачатьНачать бесплатно

Матрица косинусного сходства для корпуса текстов

В этом упражнении вам предоставлен corpus — список из пяти предложений. Содержимое corpus выведено в консоли. Вам нужно вычислить матрицу косинусного сходства, которая содержит попарные оценки косинусного сходства для каждой пары предложений (векторизованных с помощью tf-idf).

Напомним: значение в i-й строке и j-м столбце матрицы сходства соответствует оценке сходства для i-го и j-го векторов.

Это упражнение является частью курса

Конструирование признаков для NLP на Python

Посмотреть курс

Инструкции к упражнению

  • Создайте экземпляр TfidfVectorizer и назовите его tfidf_vectorizer.
  • С помощью метода fit_transform() получите tf-idf векторы для corpus и назовите результат tfidf_matrix.
  • Используйте cosine_similarity(), передав tfidf_matrix, чтобы вычислить матрицу косинусного сходства cosine_sim.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Initialize an instance of tf-idf Vectorizer
tfidf_vectorizer = ____

# Generate the tf-idf vectors for the corpus
tfidf_matrix = tfidf_vectorizer.fit_transform(____)

# Compute and print the cosine similarity matrix
cosine_sim = ____(____, tfidf_matrix)
print(cosine_sim)
Редактировать и запускать код