Zacznij terazZacznij za darmo

Usuwanie nieprawidłowych wierszy

Po pomyślnym usunięciu wierszy z komentarzami otrzymujesz informacje o ogólnym formacie danych. DataFrame powinien zawierać co najmniej 5 kolumn rozdzielonych tabulatorami. Pamiętaj, że pierwotny DataFrame ma tylko jedną kolumnę – trzeba więc podzielić dane według znaku tabulacji (\t).

DataFrame annotations_df jest już dostępny z usuniętymi wierszami komentarzy. Biblioteka spark.sql.functions jest dostępna pod aliasem F. Początkowa liczba wierszy w DataFrame jest zapisana w zmiennej initial_count.

To ćwiczenie jest częścią kursu

Czyszczenie danych w PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz nową zmienną tmp_fields, dzieląc kolumnę '_c0' z DataFrame annotations_df według znaku tabulacji.
  • Dodaj do annotations_df nową kolumnę o nazwie 'colcount', która reprezentuje liczbę pól zdefiniowanych w poprzednim kroku.
  • Odfiltruj z annotations_df wszystkie wiersze zawierające mniej niż 5 pól.
  • Policz wiersze w DataFrame i porównaj wynik z wartością initial_count.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Split _c0 on the tab character and store the list in a variable
tmp_fields = ____(annotations_df['_c0'], ____)

# Create the colcount column on the DataFrame
annotations_df = annotations_df.____('____', ____(____))

# Remove any rows containing fewer than 5 fields
annotations_df_filtered = annotations_df.____(~ (____))

# Count the number of rows
final_count = ____
print("Initial count: %d\nFinal count: %d" % (initial_count, final_count))
Edytuj i uruchom kod