เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การสร้างข้อมูล context window feature

เทคนิค moving window มีประโยชน์สำหรับโมเดล machine learning ที่ใช้ข้อมูล context window feature

ตาราง text ที่มีคอลัมน์ id, word, part, title พร้อมใช้งานในพื้นที่ทำงานของคุณแล้ว ตารางนี้มีเนื้อหาบทที่ 9, 10, 11 และ 12 จากหนังสือ Sherlock Holmes โดยแต่ละคำถูกประมวลผลและจัดเรียงเป็นหนึ่งคำต่อแถว คำแต่ละคำมีดัชนีจำนวนเต็มที่ไม่ซ้ำกันในคอลัมน์ id โดย id ที่มีค่าน้อยกว่าหมายถึงคำที่ปรากฏก่อนในข้อความ และค่าที่มากกว่าหมายถึงคำที่ปรากฏทีหลัง

10 แถวแรกของชุดข้อมูลสำหรับบทที่ 12 แสดงในคอนโซลเป็น Table1 ส่วน 10 แถวแรกของผลลัพธ์ที่ต้องการ โดยจำกัดให้แสดงเฉพาะ part 12 (บทที่ 12) แสดงเป็น Table2 ใน Table2 คำ "หลัก" ของแต่ละแถวอยู่ในคอลัมน์ w3 คอลัมน์ w1 และ w2 แสดงสองคำที่อยู่ก่อนหน้าคำหลัก ส่วนคอลัมน์ w4 และ w5 แสดงสองคำที่อยู่ถัดไปหลังคำหลัก

สังเกตว่า w1 และ w2 เป็น null ในแถวแรก เนื่องจากไม่มีคำใดก่อนหน้า w3 (ในที่นี้คือ "xii") ที่อยู่ใน part 12

หากลืมขั้นตอนที่ทำในวิดีโอ สามารถดูสไลด์ที่แสดงทางด้านขวาของคอนโซลได้เลย

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Introduction to Spark SQL in Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • ดึงคำของแต่ละแถว พร้อมกับสองคำก่อนหน้าและสองคำถัดไป

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Word for each row, previous two and subsequent two words
query = """
SELECT
part,
LAG(word, 2) OVER(PARTITION BY ____ ORDER BY ____) AS w1,
LAG(word, ____) OVER(____ BY part ____ BY id) AS w2,
word AS w3,
____(word, 1) OVER(____ BY part ____ BY id) AS w4,
LEAD(word, 2) OVER(____ BY part ____ BY id) AS w5
FROM text
"""
spark.sql(query).where("part = 12").show(10)
แก้ไขและรันโค้ด