ÎncepețiÎncepe gratuit

Verificări ale calității datelor

Așa cum ai învățat în videoclipul anterior, valorile lipsă pot duce la pierderea unor informații valoroase și pot genera interpretări incorecte. În mod similar, prezența valorilor nevăzute poate afecta și ea nivelul de încredere al modelului.

În acest exercițiu, scopul tău este să explorezi dacă setul de date pentru rezervările hoteliere conține valori lipsă și să identifici eventuale valori nevăzute. Seturile de date de referință și de analiză sunt deja încărcate, împreună cu biblioteca nannyml.

O scurtă reamintire: dacă nu îți amintești tipurile coloanelor, poți explora cu ușurință datele folosind metoda .head().

Acest exercițiu face parte din cursul

Monitorizarea Machine Learning în Python

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Define analyzed columns
selected_columns = ['country', 'lead_time', 'parking_spaces', 'hotel']

# Intialize missing values calculator
ms_calc = ____.____(
    ____=____,
    ____=____,
    timestamp_column_name='timestamp'
)

# Fit, calculate and plot the results
ms_calc.fit(reference)
ms_results = ms_calc.calculate(analysis)
ms_results.plot().show()
Editează și rulează codul