Oppgave #64
Forfatter:Mihnea-Teodor Stoica🥈IOAI 2026 Silver Medalist
Vanskelighetsgrad
Din beste poengsum
N/A
I en parallell verden av sosiale nettverk er Chirper den mest populære plattformen for mikromeldinger.
Nylig ble plattformen kjøpt opp av den berømte (og litt eksentriske) Melon Husk, som bestemte seg for å rebrandinge den under navnet Y.
For å gjøre Y renere og mer vennlig, ber Melon Husk ditt data science-team om å bygge en klassifiseringsmodell som automatisk kan oppdage problematiske chirp-er (spam, irrelevant innhold eller støy), slik at disse kan filtreres ut fra feeden.
Du har fått et sett med historiske chirp-er og må bygge en modell
som kan klassifisere nye chirp-er.
Du har fått tilgang til to filer:
label (problematic = 1 / normal = 0)Hovedmål: prediksjon av sannsynligheten for at en chirp er problematisk
(verdi mellom 0 og 1, hvor 0 = chirp sikkert normal, 1 = chirp sikkert problematisk).
Hver rad representerer en chirp publisert på Chirper Y, med følgende attributter:
id – unik identifikator for chirp-enchirp – teksten til chirp-enlabel – kun i train.csv, 1 (problematisk) / 0 (normal)Endelig mål: prediker label for radene i test.csv.
De to første deloppgavene verifiserer enkel analyse av chirp-ene.
Den siste deloppgaven evaluerer ytelsen til klassifiseringsmodellen.
Bestem lengden på hver chirp som antall tegn.
Vis for denne deloppgaven et heltall.
Tell hvor mange forekomster av tegnet # som finnes i chirp-en
(viktig indikator for overdrevne hashtags, elsket av spammere 😄).
Bygg en klassifiseringsmodell som predikerer sannsynligheten for at en chirp
er problematisk (p ∈ [0,1]) for hver rad i test.
Evalueringen gjøres ved hjelp av ROC curve og AUC (Area Under the ROC Curve).
Deloppgaver 1–2 evalueres eksakt (ved sammenligning).
Filen submission.csv må inneholde 3 linjer for hver rad i test,
tilsvarende de 3 deloppgavene.
Struktur:
subtaskID,datapointID,answerhvor:
hvor:
id# (heltall)id = 25758:subtaskID,datapointID,answer1,25758,212,25758,03,25758,0.083For Deloppgave 3 gjøres evalueringen ved hjelp av ROC AUC (Area Under the ROC Curve).
Dette er et unikt mål som sammenfatter ytelsen til en klassifiserer
for alle mulige beslutningsgrenser.
ROC-kurven tegnes, som representerer:
Arealet under kurven (AUC) beregnes ved hjelp av trapesregelen:
Tolkning av poengsummen: