Opgave #64
Forfatter:Mihnea-Teodor Stoica🥈IOAI 2026 Silver Medalist
Sværhedsgrad
Din bedste score
N/A
I en parallel verden af sociale netværk er Chirper den mest populære platform for mikrobeskeder.
For nylig blev platformen købt af den berømte (og let excentriske) Melon Husk, som har besluttet at rebrande den under navnet Y.
For at gøre Y renere og mere venligt, beder Melon Husk dit data science-team om at bygge en klassifikationsmodel, der automatisk kan opdage problematiske chirps (spam, irrelevant indhold eller støj), så disse kan filtreres fra feedet.
Du har modtaget et sæt historiske chirps og skal bygge en model,
der kan klassificere nye chirps.
Du har fået stillet to filer til rådighed:
label (problematic = 1 / normal = 0)Hovedformål: forudsigelse af sandsynligheden for at et chirp er problematisk
(værdi mellem 0 og 1, hvor 0 = chirp sikkert normalt, 1 = chirp sikkert problematisk).
Hver række repræsenterer et chirp publiceret på Chirper Y, med følgende attributter:
id – unik identifikator for chirpetchirp – chirpets tekstlabel – kun i train.csv, 1 (problematisk) / 0 (normal)Endemål: forudsig label for rækkerne i test.csv.
De første to subtasks verificerer simpel analyse af chirps.
Det sidste subtask evaluerer klassifikationsmodellens performance.
Bestem længden af hvert chirp som antal tegn.
Vis for dette subtask et heltal.
Tæl hvor mange forekomster af tegnet # der findes i chirpet
(vigtig indikator for overdrevne hashtags, elsket af spammere 😄).
Byg en klassifikationsmodel, der forudsiger sandsynligheden for at et chirp
er problematisk (p ∈ [0,1]) for hver række i test.
Evaluering sker ved hjælp af ROC curve og AUC (Area Under the ROC Curve).
Subtasks 1–2 evalueres nøjagtigt (ved sammenligning).
Filen submission.csv skal indeholde 3 linjer for hver række i test,
svarende til de 3 subtasks.
Struktur:
subtaskID,datapointID,answerhvor:
hvor:
id# (heltal)id = 25758:subtaskID,datapointID,answer1,25758,212,25758,03,25758,0.083For Subtask 3 sker evalueringen ved hjælp af ROC AUC (Area Under the ROC Curve).
Dette er et unikt mål, der sammenfatter en klassifikators performance
for alle mulige beslutningsgrænser.
ROC-kurven tegnes, som repræsenterer:
Arealet under kurven (AUC) beregnes ved hjælp af trapezreglen:
Fortolkning af scoren: