Trudność
Twój najlepszy wynik
Nie dotyczy
Na przestrzeni lat wyniki egzaminu maturalnego dostarczają szczegółowego obrazu wydajności liceów w Rumunii. Analizując dane historyczne z kilku lat, możemy odkryć trendy, ewolucję wyników szkolnych i czasami rezultaty, które odbiegają od normy.
W tym kontekście celem tego problemu jest statystyczna analiza wydajności liceów na maturze, budowa modeli predykcyjnych i identyfikacja nietypowych wyników przy użyciu metod Machine Learning.
Aby rozwiązać wymagania tego problemu, masz dostęp do zbioru danych ustrukturyzowanego w formie dwóch plików csv: train.csv i test.csv. Ten zbiór danych zawiera zagregowane wyniki liceów z różnych przedmiotów egzaminu maturalnego za okres 2014–2023.
Każdy wiersz w zbiorze danych (niezależnie od tego, czy chodzi o zbiór treningowy czy testowy) reprezentuje wyniki liceum z przedmiotu w roku.
id – unikalny identyfikator wierszaan – rok egzaminuliceu – nazwa liceumjudet – województwo, w którym znajduje się liceummaterie – przedmiot maturalnymedie – średnia ocen uzyskanych przez uczniów liceum z danego przedmiotuprocent_reusita – procent uczniów, którzy zdali egzaminnumar_candidati – liczba kandydatówpreferinta_materie – procent uczniów, którzy wybrali dany przedmiotanomalie - może mieć wartość 0 jeśli nie jest uważana za sytuację anormalną lub wartość 1 jeśli sytuacja jest niezwykła.Uwaga: Dla każdego liceum mamy również ogólne statystyki. W tych przypadkach w kolumnie materie znajdujemy wartość GENERAL.
Plik train.csv zawiera statystyki z okresu 2014-2022, a plik test.csv zawiera dane za rok 2023, jednak kolumny medie i anomalie nie są dostępne.
Zidentyfikuj, który przedmiot miał największą preferencję w roku 2023 w COLEGIUL NATIONAL "UNIREA" FOCSANI, jeśli wykluczymy przedmiot LIMBA ROMANA, który był obowiązkowy dla wszystkich kandydatów.
Zidentyfikuj, w którym roku z okresu 2014-2022 przedmiot INFORMATICA MI C-C++ miał największą popularność w COLEGIUL NATIONAL "UNIREA" FOCSANI. Uważamy, że popularność jest określana przez procent z kolumny preferinta_materie (im wyższy ten procent, tym bardziej uważamy, że przedmiot był popularny).
Używając informacji dostępnych w pliku train.csv, oszacuj wartość uzyskanej średniej dla każdego wiersza z pliku test.csv (rok 2023).
Do tego wymagania możesz użyć dowolnej metody analizy statystycznej lub modelowania opartego na danych historycznych, biorąc pod uwagę:
Celem jest uzyskanie oszacowań jak najbliższych rzeczywistym wartościom.
Przeanalizuj dane historyczne z okresu 2014–2022 i zdecyduj dla każdego wiersza z pliku test.csv, czy odpowiadający mu wynik z roku 2023 jest:
W podejmowaniu decyzji możesz wziąć pod uwagę:
Końcowy wynik dla każdego wiersza musi być etykietą binarną:
0 - wynik normalny1 - wynik nietypowyDo automatycznej oceny musisz przesłać plik w formacie csv o następującej strukturze:
id – identyfikator wiersza (odpowiadający temu z test.csv)
ididsubtaskID – identyfikator wymagania:
1 dla identyfikacji preferowanego przedmiotu (wymaganie 1)2 dla identyfikacji pomyślnego roku dla Informatyki (wymaganie 2)3 dla oszacowania średniej (wymaganie 3)4 dla identyfikacji nietypowych wyników (wymaganie 4)answer – odpowiedź odpowiadająca wymaganiu:
subtaskID = 1: nazwa przedmiotu dokładnie tak, jak pojawia się w zbiorze danychsubtaskID = 2: roksubtaskID = 3: wartość numeryczna (oszacowanie średniej)subtaskID = 4: 0 lub 1Dla wymagań 1–2 ocena jest dokładna (przez porównanie).
Dla wymagania 3 ocena jest przeprowadzana przy użyciu Mean Absolute Error (MAE).
Zasady:
Dla wymagania 4 punkty są przyznawane zgodnie z następującymi zasadami: