Problème #202
Auteur:Catalin Chiru
Difficulté
Votre meilleur score
N/D
À la suite d'un phénomène cosmique appelé Convergence du Chaos, des personnages de plusieurs univers de bandes dessinées ont été réunis dans une seule réalité. L'Agence Interdimensionnelle de Surveillance des Héros (AIME) a centralisé les données sur ces héros afin de pouvoir analyser rapidement leurs profils et prendre des décisions automatisées.
Les données enregistrées décrivent à la fois les caractéristiques générales des personnages, ainsi que leurs capacités et statistiques numériques associées. L'analyse de ces données est importante pour :
Pour résoudre le problème, vous disposerez de deux fichiers :
train.csv – contient des exemples étiquetés, utilisés pour l'analyse et l'entraînement des modèles ;test.csv – contient les mêmes variables, mais n'inclut pas les colonnes powerstats__combat et Super Strength, qui doivent être prédites dans le Task 3 et le Task 4.Dans le jeu de données apparaissent des personnages provenant de plusieurs univers éditoriaux, par exemple :
Dans ce problème, la notion d'« univers » correspond à la valeur de la colonne Publisher.
Chaque ligne des fichiers train.csv et test.csv correspond à un personnage.
Le jeu de données contient :
id ;powerstats__... ;Exemples de colonnes :
| Column | DType | Description |
|---|---|---|
| id | int | Identifiant unique du personnage |
| name | object | Nom du personnage |
| Publisher | object | Éditeur / univers éditorial |
| Gender | object | Genre du personnage |
| Race | object | Espèce / race |
| Eye color | object | Couleur des yeux |
| Hair color | object | Couleur des cheveux |
| Height | float | Taille du personnage |
| Weight | float | Poids du personnage |
| Alignment | object | Alignement : good, bad, neutral ou - |
| powerstats__intelligence | float | Niveau d'intelligence |
| powerstats__strength | float | Niveau de force |
| powerstats__speed | float | Niveau de vitesse |
| powerstats__durability | float | Niveau de résistance |
| powerstats__power | float | Niveau général de puissance |
| powerstats__combat | float | Niveau de combat (uniquement dans train.csv) |
| Super Strength | int | Capacité binaire : super-force (uniquement dans train.csv) |
| Agility | int | Capacité binaire : agilité |
| Flight | int | Capacité binaire : vol |
En utilisant les données du fichier train.csv, déterminez combien de valeurs distinctes apparaissent dans la colonne Publisher.
En utilisant les données du fichier train.csv, considérez uniquement les personnages pour lesquels Alignment = good.
Déterminez quel est l'éditeur qui contient le plus de héros positifs.
En cas d'égalité, on choisit l'éditeur qui apparaît en premier dans l'ordre alphabétique.
powerstats__combat (40 points)Sur la base des données du fichier train.csv, entraînez un modèle capable de prédire les valeurs de l'attribut powerstats__combat pour chaque personnage de test.csv.
Super Strength (40 points)Sur la base des données du fichier train.csv, entraînez un modèle capable de prédire les valeurs de l'attribut Super Strength pour chaque personnage de test.csv.
Les valeurs autorisées sont (les prédictions doivent être des étiquettes binaires finales, pas des probabilités) :
0.01.0Le fichier de soumission doit être au format csv et contenir les colonnes suivantes :
| Column | Description |
|---|---|
| id | Identifiant de l'entité évaluée |
| subtaskID | Identifiant de la tâche pour laquelle la réponse est envoyée |
| answer | Valeur calculée ou prédite |
Les valeurs possibles pour subtaskID sont :
| subtaskID | Task |
|---|---|
| task1 | Nombre d'univers distincts |
| task2 | L'éditeur avec le plus de héros positifs |
| task3 | Prédiction de powerstats__combat |
| task4 | Prédiction de la capacité Super Strength |
Pour le Task 1 et le Task 2, la réponse est globale et se transmet en utilisant la valeur spéciale GLOBAL dans la colonne id.
submission.csvid,subtaskID,answerGLOBAL,task1,1GLOBAL,task2,Cartoon Network43,task3,2.5750,task3,5.171,task4,0.04,task4,1.0Le score total est de 100 points.
L'évaluation se fait par comparaison exacte entre la valeur envoyée et la réponse correcte.
L'évaluation se fait par comparaison exacte entre la valeur envoyée et la réponse correcte.
Pour le Task 3, la métrique MAE (Mean Absolute Error) est utilisée.
Le score est attribué comme suit :
MAE ≤ 12.0, 40 points sont accordés ;MAE ≥ 30.0, 0 point est accordé ;La formule utilisée est :
score_task3 = 40 × (30 - MAE) / (30 - 12), pour 12 < MAE < 30Pour le Task 4, la métrique Accuracy est utilisée.
Le score est attribué comme suit :
Accuracy ≥ 0.90, 40 points sont accordés ;Accuracy ≤ 0.55, 0 point est accordé ;La formule utilisée est :
score_task4 = 40 × (Accuracy - 0.55) / (0.90 - 0.55), pour 0.55 < Accuracy < 0.90