Ülesanne #3
Autor:ML de bază
Raskusaste
Sinu parim tulemus
Puudub
Soovitakse ehitada klassifitseerimismudel, mis määraks lille liigi tema omaduste põhjal.
Iga näidis on iseloomustatud 4 numbrilise atribuudiga: kroonlehe ja õielehe pikkus ja laius, ning silt (species) näitab lille liiki:
setosaversicolorvirginicaSeda tüüpi probleem kuulub mitme klassi klassifitseerimise (multi-class classification) kategooriasse.
Andmestik on tuletatud klassikalisest Iris kogust (UCI ML Repository).
sepal_lengthsepal_widthpetal_lengthpetal_widthtrain.csvSisaldab kõiki 4 tunnuste veergu pluss veerg:
target – esindab lille liiki (0=setosa, 1=versicolor, 2=virginica)Näide:
sepal_length_(cm) sepal_width_(cm) petal_length_(cm) petal_width_(cm) target SampleID8 4.4 2.9 1.4 0.2 0 9106 4.9 2.5 4.5 1.7 2 10776 6.8 2.8 4.8 1.4 1 779 4.9 3.1 1.5 0.1 0 1089 5.5 2.5 4.0 1.3 1 90test.csvSisaldab samu veerge ilma target-ita, kuid sisaldab SampleID-d.
Näide:
sepal_length_(cm) sepal_width_(cm) petal_length_(cm) petal_width_(cm) SampleID38 4.4 3.0 1.3 0.2 39127 6.1 3.0 4.9 1.8 12857 4.9 2.4 3.3 1.0 5893 5.0 2.3 3.3 1.0 9442 4.4 3.2 1.3 0.2 43Väljundfail (submission.csv) peab sisaldama täpselt kahte veergu:
SampleIDlabel – ennustatud liik (0, 1 või 2)Näide:
| SampleID | label |
|---|---|
| 101 | 1 |
| 102 | 2 |
| 103 | 0 |
Mudelite hindamine toimub järgmise mõõdiku abil:
See mõõdik sobib mitme klassi klassifitseerimiseks, kuna annab võrdse kaalu igale klassile, olenemata näidete arvust igas klassis.
Üldine valem:
kus C on klasside arv ja F1_i on F1-skoor klassi i jaoks.
Lõplik skoor väljendatakse protsendina (0–100), ümardatuna kahe kümnendkohani.
Andmestik pärineb originaalsest kogust:
UCI Machine Learning Repository – Iris Data Set