Raskusaste
Sinu parim tulemus
Puudub
Aastate jooksul annavad gümnaasiumi lõpueksamite tulemused üksikasjaliku pildi Rumeenia gümnaasiumide jõudlusest. Analüüsides ajaloolisi andmeid mitme aasta vältel, võime avastada trende, koolisoorituse arengut ja mõnikord mustrist välja jäävaid tulemusi.
Selles kontekstis on selle ülesande eesmärk analüüsida statistiliselt gümnaasiumide jõudlust lõpueksamitel, ehitada ennustusmudeleid ja tuvastada ebatüüpilisi tulemusi masinõppe meetodite abil.
Selle ülesande nõuete lahendamiseks on teil juurdepääs struktureeritud andmestikule kahe csv-faili kujul: train.csv ja test.csv. See andmestik sisaldab gümnaasiumide koondtulemusi erinevate lõpueksami ainete kohta ajavahemikul 2014–2023.
Iga rida andmestikus (olenemata sellest, kas tegemist on treenimis- või testikomplektiga) esindab gümnaasiumi tulemusi ühe aine kohta ühel aastal.
id – rea unikaalne identifikaatoran – eksami aastaliceu – gümnaasiumi nimetusjudet – maakond, kus gümnaasium asubmaterie – lõpueksami ainemedie – gümnaasiumi õpilaste poolt vastava aine eest saadud hinnete keskmineprocent_reusita – õpilaste protsent, kes eksami läbisidnumar_candidati – kandidaatide arvpreferinta_materie – õpilaste protsent, kes vastava aine valisidanomalie - võib olla väärtusega 0, kui see ei ole ebatavalise olukorra puhul, või väärtusega 1, kui olukord on ebaharilik.Märkus: Iga gümnaasiumi kohta on meil ka üldised statistikad. Nende puhul leiame veerust materie väärtuse GENERAL.
Fail train.csv sisaldab statistikaid ajavahemikust 2014-2022, fail test.csv sisaldab andmeid aasta 2023 kohta, kuid veerud medie ja anomalie ei ole saadaval.
Tuvastage, milline oli 2023. aastal kõige suurema eelistusega aine COLEGIUL NATIONAL "UNIREA" FOCSANI koolis, kui välistame aine LIMBA ROMANA, mis oli kõigile kandidaatidele kohustuslik.
Tuvastage, millisel aastal ajavahemikust 2014-2022 oli aine INFORMATICA MI C-C++ kõige populaarsem COLEGIUL NATIONAL "UNIREA" FOCSANI koolis. Loeme, et populaarsust näitab veeru preferinta_materie protsent (mida suurem see protsent, seda populaarsemaks loeme ainet).
Kasutades failis train.csv saadaolevat teavet, hinnake saadud keskmise väärtust iga rea kohta failis test.csv (aasta 2023).
Selle nõude jaoks võite kasutada mis tahes statistilise analüüsi või modelleerimise meetodit, mis põhineb ajaloolistel andmetel, arvestades:
Eesmärk on saada hinnanguid, mis on võimalikult lähedal tegelikele väärtustele.
Analüüsige ajaloolisi andmeid ajavahemikust 2014–2022 ja otsustage iga faili test.csv rea kohta, kas 2023. aasta vastav tulemus on:
Otsuse tegemisel võite arvestada:
Lõplik tulemus iga rea kohta peab olema binaarne silt:
0 - tavaline tulemus1 - ebatüüpiline tulemusAutomaatseks hindamiseks peate üles laadima faili csv formaadis järgmise struktuuriga:
id – rea identifikaator (vastav test.csv omale)
id väärtust 1id väärtust 2subtaskID – nõude identifikaator:
1 eelistatud aine tuvastamiseks (nõue 1)2 informaatika õitseaasta tuvastamiseks (nõue 2)3 keskmise hindamiseks (nõue 3)4 ebatüüpiliste tulemuste tuvastamiseks (nõue 4)answer – nõudele vastav vastus:
subtaskID = 1 jaoks: aine nimetus täpselt nii, nagu see andmestikus esinebsubtaskID = 2 jaoks: aastasubtaskID = 3 jaoks: numbriline väärtus (keskmise hinnang)subtaskID = 4 jaoks: 0 või 1Nõudeid 1–2 hinnatakse täpselt (võrdlemise teel).
Nõuet 3 hinnatakse kasutades Mean Absolute Error (MAE).
Reeglid:
Nõude 4 puhul antakse punktid järgmiste reeglite alusel: