Težina
Vaš najbolji rezultat
N/D
Tijekom godina, rezultati mature pružaju detaljnu sliku o performansama gimnazija u Rumunjskoj. Analizirajući povijesne podatke kroz više godina, možemo otkriti trendove, evoluciju školskih performansi i, ponekad, rezultate koji odstupaju od uobičajenih.
U ovom kontekstu, cilj ovog problema je statistički analizirati performanse gimnazija na maturi, konstruirati prediktivne modele i identificirati atipične rezultate koristeći metode strojnog učenja.
Za rješavanje zahtjeva ovog problema imate pristup strukturiranom skupu podataka u obliku dvaju csv datoteka: train.csv i test.csv. Ovaj skup podataka sadrži agregirane rezultate gimnazija na različitim ispitima mature, za period 2014–2023.
Svaki red u skupu podataka (bez obzira radi li se o skupu za treniranje ili testiranje) predstavlja rezultate jedne gimnazije, za jedan predmet, u jednoj godini.
id – jedinstveni identifikator redaan – godina ispitaliceu – naziv gimnazijejudet – županija u kojoj se nalazi gimnazijamaterie – predmet maturemedie – prosjek ocjena koje su učenici gimnazije postigli na tom predmetuprocent_reusita – postotak učenika koji su prošli ispitnumar_candidati – broj kandidatapreferinta_materie – postotak učenika koji su odabrali taj predmetanomalie - može imati vrijednost 0 ako se ne smatra abnormalnom situacijom ili vrijednost 1 ako je situacija neobična.Napomena: Za svaku gimnaziju imamo i neke opće statistike. Za te, u stupcu materie nalazimo vrijednost GENERAL.
Datoteka train.csv sadrži statistike iz perioda 2014-2022, a datoteka test.csv sadrži podatke za godinu 2023, ali stupci medie i anomalie nisu dostupni.
Identificirajte koji je predmet imao najveću preferenciju u godini 2023 na COLEGIUL NATIONAL "UNIREA" FOCSANI, ako isključimo predmet LIMBA ROMANA koji je bio obavezan za sve kandidate.
Identificirajte u kojoj godini iz perioda 2014-2022 je predmet INFORMATICA MI C-C++ imao najveću popularnost na COLEGIUL NATIONAL "UNIREA" FOCSANI. Smatramo da je popularnost dana postotkom iz stupca preferinta_materie (što je veći taj postotak, to ćemo smatrati da je predmet bio popularniji).
Koristeći informacije dostupne u datoteci train.csv, procijenite vrijednost postignute srednje vrijednosti za svaki red u datoteci test.csv (godina 2023).
Za ovaj zahtjev možete koristiti bilo koju metodu statističke analize ili modeliranja temeljenu na povijesnim podacima, uzimajući u obzir:
Cilj je dobivanje procjena što bližih stvarnim vrijednostima.
Analizirajte povijesne podatke iz perioda 2014–2022 i odlučite, za svaki red u datoteci test.csv, je li odgovarajući rezultat za godinu 2023:
U donošenju odluke možete uzeti u obzir:
Konačni rezultat za svaki red mora biti binarna etiketa:
0 - normalan rezultat1 - atipičan rezultatZa automatsku evaluaciju trebate učitati datoteku u csv formatu sa sljedećom strukturom:
id – identifikator reda (odgovarajući onome iz test.csv)
ididsubtaskID – identifikator zahtjeva:
1 za identificiranje omiljenog predmeta (zahtjev 1)2 za identificiranje uspješne godine za informatiku (zahtjev 2)3 za procjenu srednje vrijednosti (zahtjev 3)4 za identificiranje atipičnih rezultata (zahtjev 4)answer – odgovor odgovarajući zahtjevu:
subtaskID = 1: naziv predmeta točno kako se pojavljuje u skupu podatakasubtaskID = 2: godinasubtaskID = 3: numerička vrijednost (procjena srednje vrijednosti)subtaskID = 4: 0 ili 1Za zahtjeve 1–2 evaluacija se vrši točno (usporedbom).
Za zahtjev 3 evaluacija se vrši koristeći Mean Absolute Error (MAE).
Pravila:
Za zahtjev 4, bodovi se dodjeljuju prema sljedećim pravilima: