Probleem #21
Auteur:Mihai Nan
Moeilijkheid
Jouw beste score
N.v.t.
Het doel is het bouwen van een regressiemodel dat de dagelijkse productie van elektrische energie (kWh) van een zonnepaneel voorspelt, gebaseerd op weersomstandigheden en kenmerken van de installatie.
Elk sample vertegenwoordigt een productiedag en wordt gekarakteriseerd door verschillende numerieke attributen, zoals lichtintensiteit, luchttemperatuur, windsnelheid en andere.
Het doellabel (energy_output) vertegenwoordigt de totale energie die op die dag is gegenereerd.
Dit probleem behoort tot de categorie univariate regressie.
solar_irradiance – gemiddelde zonnestraling (W/m²)temperature – gemiddelde luchttemperatuur (°C)humidity – relatieve luchtvochtigheid (%)wind_speed – gemiddelde windsnelheid (m/s)cloud_cover – gemiddelde bewolking (%)panel_angle – hellingshoek van het paneel (°)panel_efficiency – efficiëntie van het paneel (%)train.csvBevat alle feature-kolommen plus de kolom energy_output, die de doelwaarde vertegenwoordigt.
Voorbeeld:
| SampleID | solar_irradiance | temperature | humidity | wind_speed | cloud_cover | panel_angle | panel_efficiency | energy_output |
|---|---|---|---|---|---|---|---|---|
| 1 | 750.5 | 25.2 | 40.0 | 3.5 | 10 | 30 | 18.5 | 42.3 |
| 2 | 610.0 | 22.1 | 55.0 | 2.0 | 50 | 25 | 17.0 | 28.7 |
test.csvBevat dezelfde kolommen als train.csv, maar zonder energy_output, en bevat SampleID.
Het uitvoerbestand (submission.csv) moet precies twee kolommen bevatten:
SampleIDenergy_output – de door het model voorspelde waarde (float, met 2 decimalen)Voorbeeld:
| SampleID | energy_output |
|---|---|
| 1 | 41.75 |
| 2 | 29.10 |
| 3 | 35.80 |
De evaluatie van modellen wordt gedaan met behulp van Root Mean Squared Error (RMSE):
waarbij N het aantal voorbeelden in de testset is, y_i de werkelijke waarde is en y^_i de door het model voorspelde waarde is.
De eindscore wordt geschaald tussen 0 en 100, zodat een lage RMSE tot een hoge score leidt.
De gegevens die voor dit probleem worden gebruikt, zijn synthetisch gegenereerd.