Svårighetsgrad
Din bästa poäng
Ej tillgänglig
Genom åren har resultaten från studentexamen gett en detaljerad bild av gymnasiernas prestationer i Rumänien. Genom att analysera historiska data över flera år kan vi upptäcka trender, utvecklingen av skolprestationer och ibland resultat som avviker från mönstret.
I detta sammanhang är syftet med detta problem att statistiskt analysera gymnasiernas prestationer på studentexamen, att bygga prediktiva modeller och att identifiera atypiska resultat med hjälp av Machine Learning-metoder.
För att lösa kraven för detta problem har du tillgång till en strukturerad dataset i form av två csv-filer: train.csv och test.csv. Denna dataset innehåller aggregerade resultat från gymnasier för olika prov på studentexamen, för perioden 2014–2023.
Varje rad i datasetet (oavsett om det handlar om träningsuppsättningen eller testuppsättningen) representerar resultaten för ett gymnasium, för ett ämne, under ett år.
id – unik identifierare för radenan – examensåretliceu – gymnasiets namnjudet – länet där gymnasiet finnsmaterie – studentexamensämnetmedie – medelbetyget som gymnasiets elever erhöll i respektive ämneprocent_reusita – procentandelen elever som klarade provetnumar_candidati – antal kandidaterpreferinta_materie – procentandelen elever som valde respektive ämneanomalie - kan ha värdet 0 om det inte anses vara en onormal situation eller värdet 1 om situationen är ovanlig.Observation: För varje gymnasium har vi också några allmänna statistiker. För dessa hittar vi värdet GENERAL i kolumnen materie.
Filen train.csv innehåller statistik från perioden 2014-2022, och filen test.csv innehåller data för året 2023, men kolumnerna medie och anomalie är inte tillgängliga.
Identifiera vilket ämne som hade den största preferensen år 2023 på COLEGIUL NATIONAL "UNIREA" FOCSANI, om vi utesluter ämnet LIMBA ROMANA som var obligatoriskt för alla kandidater.
Identifiera vilket år under perioden 2014-2022 som ämnet INFORMATICA MI C-C++ hade den största populariteten på COLEGIUL NATIONAL "UNIREA" FOCSANI. Vi anser att populariteten ges av procentandelen i kolumnen preferinta_materie (ju högre denna procent är, desto mer populärt anser vi att ämnet var).
Använd informationen som finns tillgänglig i filen train.csv för att uppskatta värdet på det erhållna medelbetyget för varje rad i filen test.csv (året 2023).
För detta krav kan du använda vilken metod som helst för statistisk analys eller modellering baserad på historiska data, med hänsyn till:
Målet är att få uppskattningar som är så nära de verkliga värdena som möjligt.
Analysera historiska data från perioden 2014–2022 och besluta, för varje rad i filen test.csv, om motsvarande resultat för året 2023 är:
I beslutsfattandet kan du ta hänsyn till:
Det slutliga resultatet för varje rad ska vara en binär etikett:
0 - normalt resultat1 - atypiskt resultatFör automatisk utvärdering måste du ladda upp en fil i csv-format med följande struktur:
id – radens identifierare (motsvarande den i test.csv)
ididsubtaskID – kravets identifierare:
1 för identifiering av det föredragna ämnet (krav 1)2 för identifiering av det framgångsrika året för Informatik (krav 2)3 för uppskattning av medelbetyget (krav 3)4 för identifiering av atypiska resultat (krav 4)answer – svaret som motsvarar kravet:
subtaskID = 1: ämnets namn exakt som det visas i datasetetsubtaskID = 2: åretsubtaskID = 3: ett numeriskt värde (uppskattning av medelbetyget)subtaskID = 4: 0 eller 1För kraven 1–2 utvärderas exakt (genom jämförelse).
För krav 3 görs utvärderingen med Mean Absolute Error (MAE).
Regler:
För krav 4 tilldelas poäng enligt följande regler: