Grūtības pakāpe
Jūsu labākais rezultāts
Nav pieejams
Gadu gaitā Bakalaureāta eksāmenu rezultāti sniedz detalizētu priekšstatu par Rumānijas vidusskolu sniegumu. Analizējot vēsturiskos datus vairāku gadu garumā, mēs varam atklāt tendences, izglītības snieguma attīstību un dažkārt rezultātus, kas izceļas no parastaā modeļa.
Šajā kontekstā šīs problēmas mērķis ir statistiski analizēt vidusskolu sniegumu Bakalaureāta eksāmenā, izveidot prognozējošus modeļus un identificēt atipiskus rezultātus, izmantojot mašīnmācīšanās metodes.
Lai atrisinātu šīs problēmas prasības, jums ir pieejams strukturēts datu kopums divu csv failu veidā: train.csv un test.csv. Šis datu kopums satur vidusskolu apkopotos rezultātus dažādos Bakalaureāta eksāmena priekšmetos laika posmā 2014–2023.
Katra rinda datu kopumā (neatkarīgi no tā, vai runa ir par apmācības kopu vai testēšanas kopu) pārstāv vidusskolas rezultātus priekšmetā gadā.
id – unikāls rindas identifikatorsan – eksāmena gadsliceu – vidusskolas nosaukumsjudet – apgabals, kurā atrodas vidusskolamaterie – Bakalaureāta disciplīnamedie – vidusskolas skolēnu iegūto atzīmju vidējā vērtība attiecīgajā disciplīnāprocent_reusita – skolēnu procents, kas nokārtoja pārbaudinumar_candidati – kandidātu skaitspreferinta_materie – skolēnu procents, kas izvēlējās attiecīgo disciplīnuanomalie - var būt vērtība 0, ja tā netiek uzskatīta par nenormālu situāciju, vai vērtība 1, ja situācija ir neparasta.Piezīme: Katrai vidusskolai mums ir arī vispārīga statistika. Tām materie kolonnā atrodam vērtību GENERAL.
Fails train.csv satur statistiku no perioda 2014-2022, bet fails test.csv satur datus gadam 2023, tomēr kolonnas medie un anomalie nav pieejamas.
Identificējiet, kurš bija priekšmets ar vislielāko popularitāti 2023. gadā COLEGIUL NATIONAL "UNIREA" FOCSANI, ja izslēdzam priekšmetu LIMBA ROMANA, kas bija obligāts visiem kandidātiem.
Identificējiet, kurā gadā no perioda 2014-2022 priekšmets INFORMATICA MI C-C++ bija vispopulārākais COLEGIUL NATIONAL "UNIREA" FOCSANI. Uzskatām, ka popularitāti nosaka procents no kolonnas preferinta_materie (jo lielāks šis procents, jo populārāks mēs uzskatīsim priekšmetu).
Izmantojot pieejamo informāciju failā train.csv, novērtējiet iegūtās vidējās vērtības vērtību katrai rindai failā test.csv (2023. gads).
Šai prasībai varat izmantot jebkuru statistiskās analīzes vai modelēšanas metodi, balstoties uz vēsturiskajiem datiem, ņemot vērā:
Mērķis ir iegūt novērtējumus, kas ir pēc iespējas tuvāki reālajām vērtībām.
Analizējiet vēsturiskos datus no perioda 2014–2022 un izlemiet katrai rindai failā test.csv, vai atbilstošais 2023. gada rezultāts ir:
Lēmuma pieņemšanā varat ņemt vērā:
Galīgajam rezultātam katrai rindai jābūt binārai etiķetei:
0 - normāls rezultāts1 - atipiks rezultātsAutomātiskai novērtēšanai jums jāaugšupielādē fails csv formātā ar šādu struktūru:
id – rindas identifikators (atbilstošs tam, kas ir test.csv)
ididsubtaskID – prasības identifikators:
1 vismīļākā priekšmeta identificēšanai (1. prasība)2 sekmīgā gada identificēšanai informātikai (2. prasība)3 vidējās vērtības novērtēšanai (3. prasība)4 atipisko rezultātu identificēšanai (4. prasība)answer – atbilde, kas atbilst prasībai:
subtaskID = 1: priekšmeta nosaukums tieši tā, kā tas parādās datu kopumāsubtaskID = 2: gadssubtaskID = 3: skaitliska vērtība (vidējās vērtības novērtējums)subtaskID = 4: 0 vai 11.–2. prasībām novērtēšana notiek precīzi (salīdzinot).
Noteikumi: