शुरू करेंमुफ़्त में शुरू करें

अधूरी डेटा के लिए क्षतिपूर्ति

ज़्यादातर datasets में, अधिकांश उपयोगकर्ताओं ने केवल थोड़ी-सी items को ही रेट किया होता है। जैसा कि आपने पिछले अभ्यास में देखा, जिन उपयोगकर्ताओं के पास किसी item के लिए रेटिंग नहीं है, उन्हें आप कैसे हैंडल करते हैं, यह आपके मॉडलों की वैधता पर बड़ा असर डाल सकता है.

इस अभ्यास में, आप missing data को ऐसी जानकारी से भरेंगे जो आपके पास मौजूद डेटा में किसी तरह का पक्षपात नहीं लाएगी.

आप हर उपयोगकर्ता द्वारा दी गई सभी रेटिंग्स का औसत निकालेंगे, और फिर इसी औसत का उपयोग करके उपयोगकर्ताओं के स्कोर को शून्य के आसपास केंद्रित करेंगे। अंत में, आप खाली मानों को शून्य से भर पाएँगे, जो अब एक न्यूट्रल स्कोर है। इससे उनके समग्र प्रोफाइल पर प्रभाव न्यूनतम होगा, लेकिन उपयोगकर्ताओं की तुलना करना संभव रहेगा.

user_ratings_table, जिसमें प्रति उपयोगकर्ता एक row है, आपके लिए लोड कर दी गई है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में रिकमेंडेशन इंजन बनाना

पाठ्यक्रम देखें

अभ्यास निर्देश

  • user_ratings_table में प्रत्येक उपयोगकर्ता द्वारा दी गई रेटिंग्स का औसत निकालें और उसे avg_ratings के रूप में स्टोर करें.
  • user_ratings_table की प्रत्येक row से उसी row का औसत घटाएँ, और परिणाम को user_ratings_table_centered के रूप में स्टोर करें.
  • नई बनी user_ratings_table_centered में खाली मानों को शून्य से भरें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Get the average rating for each user 
avg_ratings = user_ratings_table.____(axis=____)

# Center each users ratings around 0
user_ratings_table_centered = user_ratings_table.____(____, axis=0)

# Fill in the missing data with 0s
user_ratings_table_normed = user_ratings_table_centered.____(____)
कोड संपादित करें और चलाएँ