コースごとの平均評価
おすすめを作るうえで効果的なのは、高評価のコースを勧めることです。DataCamp の受講生は、仲間から高く評価されているコースを好む傾向があります。
この演習では、pandas の DataFrame にある .groupby() メソッドを使って評価データを集約する変換関数 transform_avg_rating() を完成させます。目的は、コース ID とその平均評価の2列を持つ DataFrame を得ることです。
| course_id | avg_rating |
|---|---|
| 123 | 4.72 |
| 111 | 4.62 |
| … | … |
この演習では、この変換関数を完成させ、ヘルパー関数 extract_rating_data() を使って取得した生の評価データに適用します。extract_rating_data() は rating テーブルからコースの評価を抽出します。
この演習はコースの一部です
データエンジニアリング入門
演習の手順
transform_avg_rating()関数を完成させてください。course_id列でグループ化し、rating列の平均を計算します。extract_rating_data()を使って生の評価データを抽出します。引数にはデータベースエンジンdb_enginesを渡します。- 抽出した生データに対して
transform_avg_rating()を適用します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Complete the transformation function
def transform_avg_rating(rating_data):
# Group by course_id and extract average rating per course
avg_rating = rating_data.____('____').rating.____()
# Return sorted average ratings per course
sort_rating = avg_rating.sort_values(ascending=False).reset_index()
return sort_rating
# Extract the rating data into a DataFrame
rating_data = extract_rating_data(____)
# Use transform_avg_rating on the extracted data and print results
avg_rating_data = transform_avg_rating(____)
print(avg_rating_data)