Težavnost
Vaš najboljši rezultat
N/A
Skozi leta rezultati mature ponujajo podrobno sliko o uspešnosti gimnazij v Romuniji. Z analizo zgodovinskih podatkov preko več let lahko odkrijemo trende, razvoj šolske uspešnosti in včasih rezultate, ki odstopajo od vzorca.
V tem kontekstu je namen te naloge statistično analizirati uspešnost gimnazij na maturi, zgraditi napovedne modele in identificirati atipične rezultate z uporabo metod strojnega učenja.
Za reševanje zahtev te naloge imate dostop do strukturiranega nabora podatkov v obliki dveh csv datotek: train.csv in test.csv. Ta nabor podatkov vsebuje agregirane rezultate gimnazij pri različnih predmetih mature za obdobje 2014–2023.
Vsaka vrstica v naboru podatkov (ne glede na to, ali gre za učni ali testni nabor) predstavlja rezultate gimnazije pri predmetu v letu.
id – edinstveni identifikator vrsticean – leto izpitaliceu – ime gimnazijejudet – okraj, v katerem se nahaja gimnazijamaterie – predmet maturemedie – povprečje ocen, ki so jih učenci gimnazije dosegli pri tem predmetuprocent_reusita – odstotek učencev, ki so opravili izpitnumar_candidati – število kandidatovpreferinta_materie – odstotek učencev, ki so izbrali ta predmetanomalie - lahko ima vrednost 0, če se ne šteje za nenormalno situacijo, ali vrednost 1, če je situacija nenavadna.Opomba: Za vsako gimnazijo imamo tudi splošno statistiko. Za tiste v stolpcu materie najdemo vrednost GENERAL.
Datoteka train.csv vsebuje statistike iz obdobja 2014-2022, datoteka test.csv pa vsebuje podatke za leto 2023, vendar stolpca medie in anomalie nista na voljo.
Identificirajte, kateri je bil predmet z največjo priljubljenostjo v letu 2023 na COLEGIUL NATIONAL "UNIREA" FOCSANI, če izključimo predmet LIMBA ROMANA, ki je bil obvezen za vse kandidate.
Identificirajte, v katerem letu iz obdobja 2014-2022 je imel predmet INFORMATICA MI C-C++ največjo priljubljenost na COLEGIUL NATIONAL "UNIREA" FOCSANI. Menimo, da je priljubljenost določena z odstotkom iz stolpca preferinta_materie (večji kot je ta odstotek, bolj priljubljen bo predmet).
Z uporabo informacij, ki so na voljo v datoteki train.csv, ocenite vrednost doseženega povprečja za vsako vrstico v datoteki test.csv (leto 2023).
Za to zahtevo lahko uporabite katero koli metodo statistične analize ali modeliranja, ki temelji na zgodovinskih podatkih, ob upoštevanju:
Cilj je pridobiti ocene, ki so čim bližje dejanskim vrednostim.
Analizirajte zgodovinske podatke iz obdobja 2014–2022 in se za vsako vrstico v datoteki test.csv odločite, ali je ustrezni rezultat za leto 2023:
Pri sprejemanju odločitve lahko upoštevate:
Končni rezultat za vsako vrstico mora biti binarna oznaka:
0 - normalen rezultat1 - atipičen rezultatZa samodejno ocenjevanje morate naložiti datoteko v formatu csv z naslednjo strukturo:
id – identifikator vrstice (ustreza tistemu iz test.csv)
ididsubtaskID – identifikator zahteve:
1 za identifikacijo najljubšega predmeta (zahteva 1)2 za identifikacijo uspešnega leta za informatiko (zahteva 2)3 za ocenjevanje povprečja (zahteva 3)4 za identifikacijo atipičnih rezultatov (zahteva 4)answer – odgovor, ki ustreza zahtevi:
subtaskID = 1: ime predmeta točno tako, kot se pojavi v naboru podatkovsubtaskID = 2: letosubtaskID = 3: numerična vrednost (ocena povprečja)subtaskID = 4: 0 ali 1Za zahtevi 1–2 se ocenjuje natančno (s primerjavo).
Za zahtevo 3 se ocenjevanje izvaja z uporabo Mean Absolute Error (MAE).
Pravila:
Za zahtevo 4 se točke dodelijo glede na naslednja pravila: