การ Normalize ด้วย Log
การ Standardize ข้อมูลมีความสำคัญเพื่อให้ฟีเจอร์ทุกตัวสามารถเปรียบเทียบกันได้ การ Normalize ด้วย Log เป็นวิธี Standardization ที่นิยมใช้กัน ในแบบฝึกหัดนี้จะตรวจสอบค่าความแปรปรวนของฟีเจอร์ที่เลือกไว้ และคำนวณค่ามัธยฐานของความแปรปรวนโดยรวม โดยฟีเจอร์ที่ใช้จะเป็นฟีเจอร์ประเภทตัวเลข ยกเว้นคอลัมน์ click, banner_pos, device_type และคอลัมน์ search_engine_type, product_type, advertiser_type จากบทเรียนที่แล้ว เนื่องจากคอลัมน์เหล่านั้นเป็นคอลัมน์ประเภท Categorical จากนั้นจะ Apply Log Normalization กับคอลัมน์ที่มีค่าความแปรปรวนสูงกว่าค่ามัธยฐาน และตรวจสอบผลลัพธ์
โมดูล pandas พร้อมใช้งานในชื่อ pd และ DataFrame ตัวอย่างถูกโหลดไว้เป็น df
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การพยากรณ์ CTR ด้วย Machine Learning ใน Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Select numeric columns and print variance
num_df = df.____(include=['int', 'float'])
filter_cols = ['click', 'banner_pos', 'device_type',
'search_engine_type', 'product_type', 'advertiser_type']
new_df = num_df[num_df.columns[~num_df.columns.____(filter_cols)]]
median = new_df.____.____
print(median)