加载中...
题目 #21
作者:Mihai Nan
难度
您的最佳成绩
不适用
需要构建一个回归模型来预测太阳能电池板的日发电量(kWh),基于气象条件和安装特性。
每个样本代表一天的发电情况,通过多个数值属性进行特征化,如光照强度、气温、风速等。
目标标签(energy_output)表示该天产生的总能量。
这个问题属于单变量回归类别。
solar_irradiance – 平均太阳辐射(W/m²)temperature – 平均气温(°C)humidity – 相对湿度(%)wind_speed – 平均风速(m/s)cloud_cover – 平均云层覆盖率(%)panel_angle – 电池板倾斜角度(°)panel_efficiency – 电池板效率(%)train.csv包含所有特征列加上energy_output列,后者代表目标值。
示例:
| SampleID | solar_irradiance | temperature | humidity | wind_speed | cloud_cover | panel_angle | panel_efficiency | energy_output |
|---|---|---|---|---|---|---|---|---|
| 1 | 750.5 | 25.2 | 40.0 | 3.5 | 10 | 30 | 18.5 | 42.3 |
| 2 | 610.0 | 22.1 | 55.0 | 2.0 | 50 | 25 | 17.0 | 28.7 |
test.csv包含与train.csv相同的列,但不包含energy_output,并包含SampleID。
输出文件(submission.csv)必须包含恰好两列:
SampleIDenergy_output – 模型预测值(浮点数,保留2位小数)示例:
| SampleID | energy_output |
|---|---|
| 1 | 41.75 |
| 2 | 29.10 |
| 3 | 35.80 |
模型评估将使用均方根误差(RMSE):
其中N是测试集中的样本数量,y_i是真实值,y^_i是模型预测值。
最终分数将缩放到0到100之间,使得较小的RMSE导致较高的分数。
此问题使用的数据是合成生成的。