НачатьНачать бесплатно

Движок рекомендаций по описанию сюжета

В этом упражнении мы построим движок рекомендаций, который предлагает фильмы на основе сходства сюжетных линий. Вам предоставлена функция get_recommendations(), которая принимает название фильма, матрицу сходства и серию indices в качестве аргументов и возвращает список наиболее похожих фильмов. Серия indices уже определена.

Также вам предоставлена серия movie_plots, содержащая описания сюжетов нескольких фильмов. Ваша задача — сформировать матрицу косинусного сходства для tf-idf векторов этих описаний.

Затем мы проверим качество нашего движка, сгенерировав рекомендации для одного из моих любимых фильмов — «Тёмный рыцарь: Возрождение легенды».

Это упражнение является частью курса

Конструирование признаков для NLP на Python

Посмотреть курс

Инструкции к упражнению

  • Создайте экземпляр TfidfVectorizer с английскими стоп-словами (stop_words). Назовите его tfidf.
  • Постройте матрицу tfidf_matrix, применив fit_transform() к данным о сюжетах фильмов.
  • Сформируйте матрицу косинусного сходства cosine_sim на основе tfidf_matrix. Не используйте cosine_similarity()!
  • Вызовите get_recommendations(), чтобы получить рекомендации для 'The Dark Knight Rises'.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Initialize the TfidfVectorizer 
tfidf = ____(____='english')

# Construct the TF-IDF matrix
tfidf_matrix = tfidf.____(movie_plots)

# Generate the cosine similarity matrix
cosine_sim = ____(tfidf_matrix, tfidf_matrix)
 
# Generate recommendations 
print(get_recommendations(____, cosine_sim, indices))
Редактировать и запускать код