ค้นหา Frequent Itemset ด้วย Apriori
แบบฝึกหัดการรวมกลุ่ม (aggregation) ที่ทำสำหรับร้านค้าปลีกออนไลน์นั้นมีประโยชน์มาก ช่วยให้เห็นภาพเบื้องต้นว่าหมวดหมู่สินค้าใดปรากฏในรายการธุรกรรมบ่อยที่สุด ตอนนี้ผู้ค้าปลีกต้องการศึกษาสินค้าแต่ละรายการเพื่อหาว่ารายการใดมีความถี่สูง
ในแบบฝึกหัดนี้ จะนำอัลกอริทึม Apriori มาใช้กับชุดข้อมูลร้านค้าปลีกออนไลน์โดยไม่ผ่านการรวมกลุ่มก่อน โดยมีเป้าหมายเพื่อตัดทอน (prune) itemset ด้วยค่า support ขั้นต่ำและจำนวนสินค้าสูงสุดต่อ itemset ทั้งนี้ได้นำเข้า pandas ในชื่อ pd แล้ว และข้อมูลที่เข้ารหัสแบบ one-hot พร้อมใช้งานในตัวแปร onehot
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Market Basket Analysis ด้วย Python
คำแนะนำการฝึกหัด
- ส่ง
onehotไปยังอัลกอริทึม Apriori - กำหนดค่า support ขั้นต่ำเป็น 0.006
- กำหนดความยาวสูงสุดของ itemset เป็น 3
- แสดงตัวอย่าง 5 itemset แรก
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import apriori from mlxtend
from mlxtend.frequent_patterns import apriori
# Compute frequent itemsets using the Apriori algorithm
frequent_itemsets = apriori(____,
____ = ____,
max_len = ____,
use_colnames = True)
# Print a preview of the frequent itemsets
print(____.head())