Движок рекомендаций по описанию сюжета
В этом упражнении мы построим движок рекомендаций, который предлагает фильмы на основе сходства сюжетных линий. Вам предоставлена функция get_recommendations(), которая принимает название фильма, матрицу сходства и серию indices в качестве аргументов и возвращает список наиболее похожих фильмов. Серия indices уже определена.
Также вам предоставлена серия movie_plots, содержащая описания сюжетов нескольких фильмов. Ваша задача — сформировать матрицу косинусного сходства для tf-idf векторов этих описаний.
Затем мы проверим качество нашего движка, сгенерировав рекомендации для одного из моих любимых фильмов — «Тёмный рыцарь: Возрождение легенды».
Это упражнение является частью курса
Конструирование признаков для NLP на Python
Инструкции к упражнению
- Создайте экземпляр
TfidfVectorizerс английскими стоп-словами (stop_words). Назовите егоtfidf. - Постройте матрицу
tfidf_matrix, применивfit_transform()к данным о сюжетах фильмов. - Сформируйте матрицу косинусного сходства
cosine_simна основеtfidf_matrix. Не используйтеcosine_similarity()! - Вызовите
get_recommendations(), чтобы получить рекомендации для'The Dark Knight Rises'.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Initialize the TfidfVectorizer
tfidf = ____(____='english')
# Construct the TF-IDF matrix
tfidf_matrix = tfidf.____(movie_plots)
# Generate the cosine similarity matrix
cosine_sim = ____(tfidf_matrix, tfidf_matrix)
# Generate recommendations
print(get_recommendations(____, cosine_sim, indices))