Difficoltà
Il tuo miglior punteggio
N/D
Nel corso degli anni, i risultati dell'esame di Maturità offrono un quadro dettagliato delle prestazioni dei licei in Romania. Analizzando dati storici su più anni, possiamo scoprire tendenze, l'evoluzione delle prestazioni scolastiche e, talvolta, risultati che si discostano dal modello.
In questo contesto, l'obiettivo di questo problema è analizzare statisticamente le prestazioni dei licei alla Maturità, costruire modelli predittivi e identificare risultati atipici utilizzando metodi di Machine Learning.
Per risolvere i requisiti di questo problema avete accesso a un dataset strutturato sotto forma di due file csv: train.csv e test.csv. Questo set di dati contiene risultati aggregati dei licei a diverse prove dell'esame di Maturità, per il periodo 2014–2023.
Ogni riga del set di dati (sia che si tratti del set di addestramento che di quello per il test) rappresenta i risultati di un liceo, per una materia, in un anno.
id – identificatore unico della rigaan – anno dell'esameliceu – denominazione del liceojudet – provincia in cui si trova il liceomaterie – disciplina di Maturitàmedie – media dei voti ottenuti dagli studenti del liceo nella disciplina rispettivaprocent_reusita – percentuale degli studenti che hanno superato la provanumar_candidati – numero di candidatipreferinta_materie – percentuale degli studenti che hanno scelto la disciplina rispettivaanomalie - può avere il valore 0 se non è considerata una situazione anomala o il valore 1 se la situazione è insolita.Osservazione: Per ogni liceo abbiamo anche alcune statistiche generali. Per quelle, nella colonna materie troviamo il valore GENERAL.
Il file train.csv contiene le statistiche provenienti dal periodo 2014-2022, mentre il file test.csv contiene i dati per l'anno 2023, tuttavia le colonne medie e anomalie non sono disponibili.
Identificate quale è stata la materia con la maggiore preferenza nell'anno 2023 al COLEGIUL NATIONAL "UNIREA" FOCSANI, se escludiamo la materia LIMBA ROMANA che è stata obbligatoria per tutti i candidati.
Identificate in quale anno del periodo 2014-2022 la materia INFORMATICA MI C-C++ ha avuto la maggiore popolarità al COLEGIUL NATIONAL "UNIREA" FOCSANI. Consideriamo che la popolarità sia data dalla percentuale della colonna preferinta_materie (quanto più alta è questa percentuale, tanto più considereremo che la materia sia stata popolare).
Utilizzando le informazioni disponibili nel file train.csv, stimate il valore della media ottenuta per ogni riga del file test.csv (anno 2023).
Per questo requisito potete utilizzare qualsiasi metodo di analisi statistica o modellazione basato sui dati storici, tenendo conto di:
L'obiettivo è ottenere stime il più possibile vicine ai valori reali.
Analizzate i dati storici del periodo 2014–2022 e decidete, per ogni riga del file test.csv, se il risultato corrispondente all'anno 2023 è:
Nel prendere la decisione potete tenere conto di:
Il risultato finale per ogni riga deve essere un'etichetta binaria:
0 - risultato normale1 - risultato atipicoPer la valutazione automatica dovete caricare un file in formato csv con la seguente struttura:
id – identificatore della riga (corrispondente a quello in test.csv)
ididsubtaskID – identificatore del requisito:
1 per l'identificazione della materia preferita (requisito 1)2 per l'identificazione dell'anno prospero per l'Informatica (requisito 2)3 per la stima della media (requisito 3)4 per l'identificazione dei risultati atipici (requisito 4)answer – risposta corrispondente al requisito:
subtaskID = 1: denominazione della materia esattamente come appare nel datasetsubtaskID = 2: l'annosubtaskID = 3: un valore numerico (stima della media)subtaskID = 4: 0 o 1Per i requisiti 1–2 si valuta esattamente (per confronto).
Per il requisito 3 la valutazione si fa utilizzando Mean Absolute Error (MAE).
Regole:
Per il requisito 4, il punteggio viene assegnato in base alle seguenti regole: