Filtrování obsahu sloupců v Pythonu
Vyzkoušel/a sis různé operace se sloupci DataFramu – teď je čas pracovat s reálnými daty. DataFrame voter_df obsahuje informace o voličích v Radě města Dallas za posledních několik let. Tento zkrácený DataFrame zahrnuje datum hlasování a jméno a pozici voliče. Tvůj manažer tě požádal, abys tato data vyčistil/a, aby je bylo možné později zapojit do požadovaných reportů. Hlavním úkolem je odstranit prázdné záznamy nebo neobvyklé znaky a vrátit konkrétní skupinu voličů, u kterých lze ověřit jejich informace.
Toto je často jeden z prvních kroků při čištění dat – odstranění všeho, co zjevně neodpovídá očekávanému formátu. U tohoto datasetu se podívej na původní data a zjisti, co v sloupci VOTER_NAME vypadá podezřele.
Knihovna pyspark.sql.functions je už naimportovaná pod aliasem F.
Toto cvičení je součástí kurzu
Cleaning Data with PySpark
Pokyny k cvičení
- Zobraz unikátní záznamy ve sloupci
VOTER_NAME. - Vyfiltruj z
voter_dfzáznamy, kde máVOTER_NAMEdélku 1–20 znaků. - Odfiltruj z
voter_dfzáznamy, kdeVOTER_NAMEobsahuje znak_. - Zobraz unikátní záznamy ve sloupci
VOTER_NAMEznovu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Show the distinct VOTER_NAME entries
voter_df.select(____).distinct().show(40, truncate=False)
# Filter voter_df where the VOTER_NAME is 1-20 characters in length
voter_df = ____('length(VOTER_NAME) > 0 and length(VOTER_NAME) < 20')
# Filter out voter_df where the VOTER_NAME contains an underscore
voter_df = voter_df.filter(~ F.col('VOTER_NAME').____)
# Show the distinct VOTER_NAME entries again
voter_df.____(____).____().____(40, truncate=False)