Împărțirea în coloane
Ai curățat considerabil datele, eliminând rândurile invalide din DataFrame. Acum vrei să aplici câteva transformări suplimentare, generând coloane specifice și semnificative pe baza conținutului DataFrame-ului.
Ai disponibil contextul spark și cea mai recentă versiune a DataFrame-ului annotations_df. pyspark.sql.functions este disponibil sub aliasul F.
Acest exercițiu face parte din cursul
Curățarea datelor cu PySpark
Instrucțiuni pentru exercițiu
- Împarte conținutul coloanei
'_c0'după caracterul tab și stochează rezultatul într-o variabilă numităsplit_cols. - Adaugă următoarele coloane pe baza primelor patru elemente din variabila de mai sus: folder, filename, width, height, într-un DataFrame numit
split_df. - Adaugă variabila
split_colsca o coloană.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Split the content of _c0 on the tab character (aka, '\t')
split_cols = ____(annotations_df['____'], '\t')
# Add the columns folder, filename, width, and height
split_df = annotations_df.withColumn('folder', split_cols.getItem(____))
split_df = split_df.withColumn('filename', ____
split_df = split_df.____
____
# Add split_cols as a column
split_df = split_df.____