Model de referință bazat pe dată
Am construit deja 3 modele de referință diferite. Pentru mai multă practică, să mai construim câteva. Primul model se bazează pe variabile de grupare. Este evident că tariful unei curse poate depinde de momentul din zi – de exemplu, prețurile ar putea fi mai mari în orele de vârf.
Scopul tău este să construiești un model de referință care să atribuie valoarea medie a „fare_amount" pentru ora corespunzătoare. Deocamdată, vei crea modelul pe întregul set train și vei face predicții pentru setul de date test.
DataFrame-urile train și test sunt disponibile în spațiul tău de lucru. În plus, coloana „pickup_datetime" din ambele DataFrame-uri a fost deja convertită la un obiect datetime.
Acest exercițiu face parte din cursul
Câștigarea unei competiții Kaggle în Python
Instrucțiuni pentru exercițiu
- Extrage ora din coloana „pickup_datetime" pentru DataFrame-urile
trainșitest. - Calculează media „fare_amount" pentru fiecare oră pe datele de antrenament.
- Realizează predicțiile pentru
testfolosind metodamap()dinpandasși gruparea obținută. - Scrie predicțiile în fișier.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Get pickup hour from the pickup_datetime column
train['hour'] = train['pickup_datetime'].dt.____
test['hour'] = test['pickup_datetime'].dt.____
# Calculate average fare_amount grouped by pickup hour
hour_groups = train.____('____')['____'].mean()
# Make predictions on the test set
test['fare_amount'] = test.hour.map(____)
# Write predictions
test[['id','fare_amount']].____('hour_mean_sub.csv', index=False)