ÎncepețiÎncepe gratuit

Model de referință bazat pe dată

Am construit deja 3 modele de referință diferite. Pentru mai multă practică, să mai construim câteva. Primul model se bazează pe variabile de grupare. Este evident că tariful unei curse poate depinde de momentul din zi – de exemplu, prețurile ar putea fi mai mari în orele de vârf.

Scopul tău este să construiești un model de referință care să atribuie valoarea medie a „fare_amount" pentru ora corespunzătoare. Deocamdată, vei crea modelul pe întregul set train și vei face predicții pentru setul de date test.

DataFrame-urile train și test sunt disponibile în spațiul tău de lucru. În plus, coloana „pickup_datetime" din ambele DataFrame-uri a fost deja convertită la un obiect datetime.

Acest exercițiu face parte din cursul

Câștigarea unei competiții Kaggle în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Extrage ora din coloana „pickup_datetime" pentru DataFrame-urile train și test.
  • Calculează media „fare_amount" pentru fiecare oră pe datele de antrenament.
  • Realizează predicțiile pentru test folosind metoda map() din pandas și gruparea obținută.
  • Scrie predicțiile în fișier.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Get pickup hour from the pickup_datetime column
train['hour'] = train['pickup_datetime'].dt.____
test['hour'] = test['pickup_datetime'].dt.____

# Calculate average fare_amount grouped by pickup hour 
hour_groups = train.____('____')['____'].mean()

# Make predictions on the test set
test['fare_amount'] = test.hour.map(____)

# Write predictions
test[['id','fare_amount']].____('hour_mean_sub.csv', index=False)
Editează și rulează codul