Menemukan urutan kata yang umum

Sebelumnya kita telah melihat cara membuat kueri yang menemukan urutan kata sepanjang tiga ("3-tuple"). Kita menggunakan kueri tersebut sebagai subkueri dalam kueri SQL tradisional untuk menemukan 3-tuple yang paling umum dalam dokumen teks. Sekarang Anda akan melakukan tugas serupa untuk menemukan 5-tuple yang paling umum.

DataFrame text_df tersedia. DataFrame ini memuat lima bab pertama dari teks Sherlock Holmes. DataFrame ini memiliki kolom: word, id, part, title. Kolom id bertipe integer, di mana kata yang muncul lebih akhir dalam dokumen memiliki id yang lebih besar daripada kata yang muncul sebelumnya. Kolom part memisahkan data per bab. DataFrame text_df juga didaftarkan sebagai tabel sementara bernama text. Tujuan kita adalah membuat himpunan data di mana setiap baris merepresentasikan sebuah 5-tuple, dengan count yang menunjukkan berapa kali tuple tersebut muncul dalam himpunan data.

Latihan ini merupakan bagian dari kursus

Pengantar Spark SQL dalam Python

Instruksi latihan

Buat sebuah kueri query yang menemukan 10 5-tuple paling umum dalam himpunan data.

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# Find the top 10 sequences of five words
query = """
SELECT w1, w2, w3, w4, w5, COUNT(*) AS count FROM (
   SELECT word AS w1,
   LEAD(____) OVER(____ ) AS w2,
   ____ AS w3,
   ____ AS w4,
   ____ AS w5
   FROM text
)
GROUP BY w1, w2, w3, w4, w5
ORDER BY count DESC, w1, w2, w3, w4, w5
LIMIT ____
"""
df = spark.sql(query)
df.show()

Edit dan Jalankan Kode

Latihan ini merupakan bagian dari kursus

Pengantar Spark SQL dalam Python

SkillTag.level.advancedSkillTag.label

4.8+

Mulai Kursus Gratis

Pada bab ini Anda akan belajar cara membuat dan melakukan kueri tabel SQL di Spark. Spark SQL menghadirkan kejelasan ekspresif SQL ke Spark. Anda juga akan mempelajari cara menggunakan window function SQL di Spark. Window function melakukan perhitungan lintas baris yang berkaitan dengan baris saat ini. Fitur ini sangat menyederhanakan pencapaian hasil yang sulit diekspresikan hanya dengan join dan agregasi tradisional. Kita akan menggunakan window function untuk melakukan penjumlahan berjalan, selisih berjalan, dan operasi lain yang menantang untuk dilakukan dalam SQL dasar.

Exercise 1: Membuat dan melakukan kueri pada tabel SQL di Spark Exercise 2: Buat tabel SQL dari sebuah dataframe Exercise 3: Menentukan nama kolom dari sebuah tabel Exercise 4: SQL fungsi window Exercise 5: Jumlah berjalan menggunakan SQL fungsi window Exercise 6: Perbaiki kueri yang rusak Exercise 7: Notasi titik dan SQL Exercise 8: Agregasi, selangkah demi selangkah Exercise 9: Mengagregasi kolom yang sama dua kali Exercise 10: Agregasi SQL dengan notasi titik Exercise 11: Konversi fungsi window dari notasi titik ke SQL

Pada bab ini, Anda akan memuat teks bahasa alami. Lalu Anda akan menerapkan analisis jendela geser untuk menemukan urutan kata yang sering muncul.

Exercise 1: Memuat teks bahasa alami Exercise 2: Memuat dataframe dari berkas parquet Exercise 3: Membagi dan meledakkan kolom teks Exercise 4: Menggunakan monotonically_increasing_id()Exercise 5: Analisis jendela bergerak Exercise 6: Membuat data fitur jendela konteks Exercise 7: Melakukan repartition pada data Exercise 8: Urutan kata umum Exercise 9: Jenis data apakah ini Exercise 10: Menemukan urutan kata yang umum

Latihan Saat Ini

Exercise 11: 5-tuple unik dalam urutan terurut Exercise 12: 3-tuple tersering per bab

Pada bab-bab sebelumnya Anda telah belajar memanfaatkan ekspresivitas window function SQL. Namun, ekspresivitas ini menjadikan pemahaman cara melakukan cache dataframe dan cache tabel SQL dengan benar semakin penting. Penting juga untuk mengetahui cara mengevaluasi aplikasi Anda. Anda akan mempelajarinya menggunakan Spark UI. Anda juga akan mempelajari praktik terbaik untuk logging di Spark. Spark SQL menghadirkan alat bermanfaat lain untuk menyetel kinerja kueri, yaitu rencana eksekusi kueri. Anda akan belajar menggunakan rencana eksekusi untuk mengevaluasi asal-usul (provenance) sebuah dataframe.

Exercise 1: Caching Exercise 2: Latihan caching: bagian 1 Exercise 3: Berlatih caching: SQL Exercise 4: Latihan caching: menggabungkan semuanya Exercise 5: Melakukan cache dan menghapus cache tabel Exercise 6: Spark UI Exercise 7: Tab storage di Spark UI Exercise 8: Memeriksa cache di Spark UI Exercise 9: Pencatatan (Logging)Exercise 10: Latihan logging Exercise 11: Latihan logging 2 Exercise 12: Rencana kueri Exercise 13: Latihan rencana kueri Exercise 14: Latihan membaca rencana kueri 2

Bab-bab sebelumnya membekali Anda dengan alat untuk memuat teks mentah, melakukan tokenisasi, dan mengekstrak urutan kata. Ini sudah sangat berguna untuk analisis, dan juga bermanfaat untuk Machine Learning. Semua yang telah Anda pelajari kini dipadukan dengan menggunakan logistic regression untuk mengklasifikasikan teks. Pada akhir bab ini, Anda akan telah memuat data teks bahasa alami mentah dan menggunakannya untuk melatih sebuah pengklasifikasi teks.

Exercise 1: Extract Transform Select Exercise 2: Latihan membuat UDF Exercise 3: Latihan kolom array Exercise 4: Membuat data fitur untuk klasifikasi Exercise 5: Membuat UDF untuk data vektor Exercise 6: Menerapkan UDF pada data vektor Exercise 7: Mengonversi teks ke format vektor Exercise 8: Klasifikasi Teks Exercise 9: Memberi label pada data Exercise 10: Membagi data Exercise 11: Latih pengklasifikasi Exercise 12: Memprediksi dan mengevaluasi Exercise 13: Evaluasi classifier Exercise 14: Prediksi data uji Exercise 15: Rekap