Opgave #45
Forfatter:Mihai Nan
Sværhedsgrad
Din bedste score
N/A
Den digitale musikindustri udvikler sig hurtigt, og streamingplatforme konkurrerer om at estimere, hvor godt en sang vil klare sig blandt lytterne. Popularitet er ikke bare et tal, da det påvirker anbefalinger, automatiserede playlister og endda kunstnerkontrakter.
For at træne et nyt forudsigelsesmodul har du modtaget et datasæt udtrukket fra Spotify, der indeholder lydkarakteristika og metadata for sange.
Dit mål er at bygge en model, der forudsiger populariteten af et nummer baseret på numeriske karakteristika og nogle hjælpeoplysninger.
Du har to filer til rådighed:
popularitypopularity (disse skal forudsiges)Hver sang har en unik identifikator og en række karakteristika:
track_id — unikt ID for nummeretartistsalbum_nametrack_namepopularity (kun i train)duration_msexplicitdanceabilityenergykeyloudnessmodespeechinessacousticnessinstrumentalnesslivenessvalencetempotime_signaturetrack_genreHovedformålet er at forudsige kolonnen popularity for testsættet.
Byg en maskinlæringsmodel, der forudsiger populariteten af hver sang fra test.csv.
Dine forudsigelser skal gemmes i en fil submission.csv med formatet:
track_id,popularity101,42.7102,55.1103,38.0hvor:
track_id — ID'et for sangen fra testpopularity — reel værdi (float), der repræsenterer den forudsagte popularitetEvalueringen vil blive foretaget ved hjælp af MAE (Mean Absolute Error):
Den endelige score beregnes baseret på den opnåede MAE-score ved hjælp af følgende regler: