EDA: Wizualizacja wszystkich danych
Aby uzyskać graficzny przegląd zbioru danych, warto zwizualizować wszystkie dostępne dane. W tym ćwiczeniu narysuj wszystkie czasy odcinków dla wszystkich zawodniczek pływających w eliminacjach na dystansie 800 metrów. Dane są dostępne w tablicach NumPy split_number i splits. Tablice są zorganizowane tak, że splits[i,j] to czas odcinka zawodniczki i dla numeru odcinka split_number[j].
To ćwiczenie jest częścią kursu
Studia przypadków w myśleniu statystycznym
Instrukcje do ćwiczenia
- Napisz pętlę
for, iterując po zestawach czasów odcinków dla każdej zawodniczki, aby:- Narysować czas odcinka w zależności od numeru odcinka. Użyj argumentów kluczowych
linewidth=1icolor='lightgray'.
- Narysować czas odcinka w zależności od numeru odcinka. Użyj argumentów kluczowych
- Oblicz średnie czasy odcinków dla każdego dystansu. Możesz to zrobić za pomocą funkcji
np.mean()z argumentem kluczowymaxis=0. Informuje tonp.mean(), aby obliczało średnie po wierszach, co da średni czas odcinka dla każdego numeru odcinka. - Narysuj średnie czasy odcinków (oś y) w zależności od numeru odcinka (oś x), używając argumentów kluczowych
marker='.',linewidth=3imarkersize=12. - Opisz osie i wyświetl wykres.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Plot the splits for each swimmer
for splitset in ____:
_ = ____(____, ____, lw=1, color='lightgray')
# Compute the mean split times
mean_splits = ____
# Plot the mean split times
# Label axes and show plot
_ = plt.xlabel('split number')
_ = plt.ylabel('split time (s)')
plt.show()