รูปแบบการทำงาน: เชื่อมต่อ — ทำงาน — ตัดการเชื่อมต่อ
การใช้งาน sparklyr มีความคล้ายคลึงกับการใช้ dplyr เมื่อข้อมูลอยู่ในฐานข้อมูลมาก ที่จริงแล้ว sparklyr จะแปลงโค้ด R ของคุณเป็นโค้ด SQL ก่อนส่งต่อไปยัง Spark
ขั้นตอนการทำงานทั่วไปมีสามขั้นตอน:
- เชื่อมต่อกับ Spark ด้วย
spark_connect() - ทำงานที่ต้องการ
- ปิดการเชื่อมต่อกับ Spark ด้วย
spark_disconnect()
ในแบบฝึกหัดนี้ คุณจะทำสิ่งที่ง่ายที่สุด นั่นคือดึงข้อมูลเวอร์ชันของ Spark ที่กำลังรันอยู่ โดยใช้ spark_version()
spark_connect() รับ URL ที่ระบุตำแหน่งของ Spark สำหรับคลัสเตอร์ในเครื่อง (ซึ่งเป็นแบบที่คุณใช้อยู่) ให้ระบุ URL เป็น "local" ส่วนคลัสเตอร์แบบรีโมต (บนเครื่องอื่น ซึ่งมักเป็นเซิร์ฟเวอร์สมรรถนะสูง) จะใช้ URL พร้อม port สำหรับการเชื่อมต่อ
spark_version() และ spark_disconnect() รับการเชื่อมต่อ Spark เป็นอาร์กิวเมนต์เดียว
ข้อควรระวัง: การเชื่อมต่อกับคลัสเตอร์ใช้เวลาหลายวินาที จึงไม่เหมาะที่จะเชื่อมต่อและตัดการเชื่อมต่อบ่อยครั้ง แม้ว่าจะต้องเชื่อมต่อใหม่ในแต่ละแบบฝึกหัดของ DataCamp แต่เมื่อนำ sparklyr ไปใช้ในการทำงานจริง ควรคงการเชื่อมต่อไว้ตลอดช่วงเวลาที่ต้องการใช้งาน Spark
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
แนะนำ Spark ด้วย sparklyr ใน R
คำแนะนำการฝึกหัด
- โหลดแพ็กเกจ
sparklyrด้วยlibrary() - เชื่อมต่อกับ Spark โดยเรียกใช้
spark_connect()พร้อมระบุอาร์กิวเมนต์master = "local"แล้วกำหนดผลลัพธ์ให้กับspark_conn - ดึงข้อมูลเวอร์ชันของ Spark ด้วย
spark_version()โดยระบุอาร์กิวเมนต์sc = spark_conn - ตัดการเชื่อมต่อจาก Spark ด้วย
spark_disconnect()โดยระบุอาร์กิวเมนต์sc = spark_conn
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Load sparklyr
___
# Connect to your Spark cluster
spark_conn <- ___
# Print the version of Spark
___
# Disconnect from Spark
___