Obtížnost
Vaše nejlepší skóre
N/A
V průběhu let poskytují výsledky maturitní zkoušky detailní obraz o výkonnosti gymnázií v Rumunsku. Analýzou historických dat za několik let můžeme objevit trendy, vývoj školní výkonnosti a někdy i výsledky, které vybočují z běžného rámce.
V tomto kontextu je cílem této úlohy statisticky analyzovat výkonnost gymnázií u maturity, vybudovat prediktivní modely a identifikovat atypické výsledky pomocí metod strojového učení.
Pro řešení požadavků této úlohy máte přístup k datasetu strukturovanému ve formě dvou csv souborů: train.csv a test.csv. Tento dataset obsahuje agregované výsledky gymnázií u různých částí maturitní zkoušky za období 2014–2023.
Každý řádek v datasetu (ať už se jedná o trénovací nebo testovací sadu) představuje výsledky gymnázia pro předmět v roce.
id – jedinečný identifikátor řádkuan – rok zkouškyliceu – název gymnáziajudet – kraj, ve kterém se gymnázium nacházímaterie – maturitní předmětmedie – průměr známek získaných studenty gymnázia u daného předmětuprocent_reusita – procento studentů, kteří zkoušku úspěšně složilinumar_candidati – počet kandidátůpreferinta_materie – procento studentů, kteří si vybrali daný předmětanomalie - může mít hodnotu 0, pokud se nejedná o abnormální situaci, nebo hodnotu 1, pokud je situace neobvyklá.Poznámka: Pro každé gymnázium máme také obecné statistiky. Pro ty najdeme ve sloupci materie hodnotu GENERAL.
Soubor train.csv obsahuje statistiky z období 2014-2022, zatímco soubor test.csv obsahuje data pro rok 2023, ale sloupce medie a anomalie nejsou dostupné.
Identifikujte, který předmět měl největší preferenci v roce 2023 na COLEGIUL NATIONAL "UNIREA" FOCSANI, pokud vyloučíme předmět LIMBA ROMANA, který byl povinný pro všechny kandidáty.
Identifikujte, ve kterém roce z období 2014-2022 měl předmět INFORMATICA MI C-C++ největší popularitu na COLEGIUL NATIONAL "UNIREA" FOCSANI. Považujeme, že popularita je dána procentem ze sloupce preferinta_materie (čím vyšší je toto procento, tím více budeme považovat předmět za populárnější).
Pomocí informací dostupných v souboru train.csv odhadněte hodnotu získaného průměru pro každý řádek ze souboru test.csv (rok 2023).
Pro tento požadavek můžete použít jakoukoli metodu statistické analýzy nebo modelování založenou na historických datech, s přihlédnutím k:
Cílem je získání odhadů co nejbližších skutečným hodnotám.
Analyzujte historická data z období 2014–2022 a rozhodněte pro každý řádek ze souboru test.csv, zda odpovídající výsledek roku 2023 je:
Při rozhodování můžete vzít v úvahu:
Konečný výsledek pro každý řádek musí být binární označení:
0 - normální výsledek1 - atypický výsledekPro automatické hodnocení musíte nahrát soubor ve formátu csv s následující strukturou:
id – identifikátor řádku (odpovídající tomu z test.csv)
ididsubtaskID – identifikátor požadavku:
1 pro identifikaci preferovaného předmětu (požadavek 1)2 pro identifikaci úspěšného roku pro informatiku (požadavek 2)3 pro odhad průměru (požadavek 3)4 pro identifikaci atypických výsledků (požadavek 4)answer – odpověď odpovídající požadavku:
subtaskID = 1: název předmětu přesně tak, jak se objevuje v datasetusubtaskID = 2: roksubtaskID = 3: numerická hodnota (odhad průměru)subtaskID = 4: 0 nebo 1Pro požadavky 1–2 se hodnotí přesně (porovnáním).
Pro požadavek 3 se hodnocení provádí pomocí Mean Absolute Error (MAE).
Pravidla:
Pro požadavek 4 se body udělují podle následujících pravidel: