Usuwanie nieprawidłowych wierszy
Po pomyślnym usunięciu wierszy z komentarzami otrzymujesz informacje o ogólnym formacie danych. DataFrame powinien zawierać co najmniej 5 kolumn rozdzielonych tabulatorami. Pamiętaj, że pierwotny DataFrame ma tylko jedną kolumnę – trzeba więc podzielić dane według znaku tabulacji (\t).
DataFrame annotations_df jest już dostępny z usuniętymi wierszami komentarzy. Biblioteka spark.sql.functions jest dostępna pod aliasem F. Początkowa liczba wierszy w DataFrame jest zapisana w zmiennej initial_count.
To ćwiczenie jest częścią kursu
Czyszczenie danych w PySpark
Instrukcje do ćwiczenia
- Utwórz nową zmienną
tmp_fields, dzieląc kolumnę'_c0'z DataFrameannotations_dfwedług znaku tabulacji. - Dodaj do
annotations_dfnową kolumnę o nazwie'colcount', która reprezentuje liczbę pól zdefiniowanych w poprzednim kroku. - Odfiltruj z
annotations_dfwszystkie wiersze zawierające mniej niż 5 pól. - Policz wiersze w DataFrame i porównaj wynik z wartością
initial_count.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Split _c0 on the tab character and store the list in a variable
tmp_fields = ____(annotations_df['_c0'], ____)
# Create the colcount column on the DataFrame
annotations_df = annotations_df.____('____', ____(____))
# Remove any rows containing fewer than 5 fields
annotations_df_filtered = annotations_df.____(~ (____))
# Count the number of rows
final_count = ____
print("Initial count: %d\nFinal count: %d" % (initial_count, final_count))