Problem #64
Författare:Mihnea-Teodor Stoica🥈IOAI 2026 Silver Medalist
Svårighetsgrad
Din bästa poäng
Ej tillgänglig
I en parallell värld av sociala nätverk är Chirper den mest populära plattformen för mikro-meddelanden.
Nyligen köptes plattformen av den berömda (och något excentriska) Melon Husk, som bestämde sig för att rebrandinga den under namnet Y.
För att göra Y renare och vänligare ber Melon Husk ditt data science-team att bygga en klassificeringsmodell som automatiskt kan upptäcka problematiska chirp (spam, irrelevant innehåll eller brus), så att dessa kan filtreras från flödet.
Du har fått en uppsättning historiska chirp och behöver bygga en modell
som kan klassificera nya chirp.
Du har fått tillgång till två filer:
label (problematic = 1 / normal = 0)Huvudsyftet: förutsäga sannolikheten att ett chirp är problematiskt
(värde mellan 0 och 1, där 0 = säkert normalt chirp, 1 = säkert problematiskt chirp).
Varje rad representerar ett chirp publicerat på Chirper Y, med följande attribut:
id – unik identifierare för chirpetchirp – chirpets textlabel – endast i train.csv, 1 (problematiskt) / 0 (normalt)Slutmålet: förutsäg label för raderna i test.csv.
De första två deluppgifterna verifierar enkel analys av chirp.
Den sista deluppgiften utvärderar klassificeringsmodellens prestanda.
Bestäm längden på varje chirp som antal tecken.
Visa för denna deluppgift ett heltal.
Räkna hur många förekomster av tecknet # som finns i chirpet
(viktig indikator för överdrivna hashtags, älskade av spammare 😄).
Bygg en klassificeringsmodell som förutsäger sannolikheten att ett chirp
är problematiskt (p ∈ [0,1]) för varje rad i test.
Utvärderingen görs med ROC-kurva och AUC (Area Under the ROC Curve).
Deluppgifter 1–2 utvärderas exakt (genom jämförelse).
Filen submission.csv måste innehålla 3 rader för varje rad i test,
motsvarande de 3 deluppgifterna.
Struktur:
subtaskID,datapointID,answerdär:
där:
id# (heltal)id = 25758:subtaskID,datapointID,answer1,25758,212,25758,03,25758,0.083För Deluppgift 3 görs utvärderingen med ROC AUC (Area Under the ROC Curve).
Detta är ett unikt mått som sammanfattar en klassificerares prestanda
för alla möjliga beslutströsklar.
ROC-kurvan ritas, som representerar:
Arean under kurvan (AUC) beräknas med trapetsregeln:
Tolkning av poängen: