Aan de slagBegin gratis

(Hey you) What's that sound?

Liedjes zijn van oorsprong analoog: het geluid bestaat uit trillingen van lucht. Om een nummer te kunnen analyseren, moet je het omzetten naar betekenisvolle getallen. Tracks in de Million Song Dataset hebben twaalf timbre-metingen die op vaste tijdsintervallen door het hele nummer heen zijn opgenomen. (Timbre is een maat voor de waargenomen klankkleur of kwaliteit van een geluid; je kunt er bijvoorbeeld stemmen mee onderscheiden van snaarinstrumenten of percussie.)

In dit hoofdstuk ga je proberen het jaar te voorspellen waarin een track is uitgebracht, op basis van de timbre. Met andere woorden: je gaat deze timbre-metingen gebruiken om features voor de modellen te genereren. (Onthoud dat een feature in Machine Learning de invoervariabele in een model is. In de statistiek worden ze vaak verklarende variabelen genoemd.)

De timbre-gegevens hebben de vorm van een matrix, waarbij rijen tijdspunten voorstellen en kolommen de verschillende timbre-metingen. Alle timbre-matrices hebben dus twaalf kolommen, maar het aantal rijen verschilt per nummer. Het gemiddelde van elke kolom schat de gemiddelde waarde van een timbre-meting over het hele nummer. Deze kunnen worden gebruikt om twaalf features voor het model te genereren.

Deze oefening maakt deel uit van de cursus

Introductie tot Spark met sparklyr in R

Bekijk cursus

Oefeninstructies

timbre, met de timbre-metingen voor Lady Gaga's "Poker Face", is al voor je gedefinieerd in je werkruimte.

  • Gebruik colMeans() om de kolomgemiddelden van timbre te berekenen. Ken de resultaten toe aan mean_timbre.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# timbre has been pre-defined
timbre

# Calculate column means
(mean_timbre <- ___)
Code bewerken en uitvoeren