เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

รูปแบบการทำงาน: เชื่อมต่อ — ทำงาน — ตัดการเชื่อมต่อ

การใช้งาน sparklyr มีความคล้ายคลึงกับการใช้ dplyr เมื่อข้อมูลอยู่ในฐานข้อมูลมาก ที่จริงแล้ว sparklyr จะแปลงโค้ด R ของคุณเป็นโค้ด SQL ก่อนส่งต่อไปยัง Spark

ขั้นตอนการทำงานทั่วไปมีสามขั้นตอน:

  1. เชื่อมต่อกับ Spark ด้วย spark_connect()
  2. ทำงานที่ต้องการ
  3. ปิดการเชื่อมต่อกับ Spark ด้วย spark_disconnect()

ในแบบฝึกหัดนี้ คุณจะทำสิ่งที่ง่ายที่สุด นั่นคือดึงข้อมูลเวอร์ชันของ Spark ที่กำลังรันอยู่ โดยใช้ spark_version()

spark_connect() รับ URL ที่ระบุตำแหน่งของ Spark สำหรับคลัสเตอร์ในเครื่อง (ซึ่งเป็นแบบที่คุณใช้อยู่) ให้ระบุ URL เป็น "local" ส่วนคลัสเตอร์แบบรีโมต (บนเครื่องอื่น ซึ่งมักเป็นเซิร์ฟเวอร์สมรรถนะสูง) จะใช้ URL พร้อม port สำหรับการเชื่อมต่อ

spark_version() และ spark_disconnect() รับการเชื่อมต่อ Spark เป็นอาร์กิวเมนต์เดียว

ข้อควรระวัง: การเชื่อมต่อกับคลัสเตอร์ใช้เวลาหลายวินาที จึงไม่เหมาะที่จะเชื่อมต่อและตัดการเชื่อมต่อบ่อยครั้ง แม้ว่าจะต้องเชื่อมต่อใหม่ในแต่ละแบบฝึกหัดของ DataCamp แต่เมื่อนำ sparklyr ไปใช้ในการทำงานจริง ควรคงการเชื่อมต่อไว้ตลอดช่วงเวลาที่ต้องการใช้งาน Spark

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

แนะนำ Spark ด้วย sparklyr ใน R

ดูคอร์ส

คำแนะนำการฝึกหัด

  • โหลดแพ็กเกจ sparklyr ด้วย library()
  • เชื่อมต่อกับ Spark โดยเรียกใช้ spark_connect() พร้อมระบุอาร์กิวเมนต์ master = "local" แล้วกำหนดผลลัพธ์ให้กับ spark_conn
  • ดึงข้อมูลเวอร์ชันของ Spark ด้วย spark_version() โดยระบุอาร์กิวเมนต์ sc = spark_conn
  • ตัดการเชื่อมต่อจาก Spark ด้วย spark_disconnect() โดยระบุอาร์กิวเมนต์ sc = spark_conn

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Load sparklyr
___

# Connect to your Spark cluster
spark_conn <- ___

# Print the version of Spark
___

# Disconnect from Spark
___
แก้ไขและรันโค้ด