სირთულე
თქვენი საუკეთესო შედეგი
არ არის
სოციალური ქსელების პარალელურ სამყაროში, Chirper არის ყველაზე პოპულარული მიკრო-შეტყობინებების პლატფორმა.
ცოტა ხნის წინ პლატფორმა იყიდა ცნობილმა (და ოდნავ ექსცენტრიკულმა) Melon Husk-მა, რომელმაც გადაწყვიტა მისი რებრენდინგი Y სახელით.
Y-ის უფრო სუფთა და მეგობრულად გასაკეთებლად, Melon Husk ითხოვს თქვენი data science გუნდისგან კლასიფიკაციის მოდელის აშენებას, რომელიც ავტომატურად აღმოაჩენს პრობლემურ chirp-ებს (სპამი, არარელევანტური კონტენტი ან ხმაური), რათა ისინი გაფილტროს feed-იდან.
მიიღეთ ისტორიული chirp-ების ნაკრები და უნდა ააშენოთ მოდელი
რომელსაც შეუძლია ახალი chirp-ების კლასიფიკაცია.
თქვენს განკარგულებაში გაქვთ ორი ფაილი:
label (problematic = 1 / normal = 0)მთავარი მიზანი: chirp-ის პრობლემურობის ალბათობის პრედიქცია
(მნიშვნელობა 0-სა და 1-ს შორის, სადაც 0 = chirp უზრუნველყოფილად ნორმალური, 1 = chirp უზრუნველყოფილად პრობლემური).
ყოველი რიგი წარმოადგენს Chirper Y-ზე გამოქვეყნებულ chirp-ს, შემდეგი ატრიბუტებით:
id – chirp-ის უნიკალური იდენტიფიკატორიchirp – chirp-ის ტექსტიlabel – მხოლოდ train.csv-ში, 1 (პრობლემური) / 0 (ნორმალური)საბოლოო მიზანი: test.csv-ის რიგებისთვის label-ის პრედიქცია.
პირველი ორი subtask ამოწმებს chirp-ების მარტივ ანალიზს.
ბოლო subtask აფასებს კლასიფიკაციის მოდელის შესრულებას.
განსაზღვრეთ ყოველი chirp-ის სიგრძე სიმბოლოების რაოდენობით.
ამ subtask-ისთვის გამოიტანეთ მთელი რიცხვი.
დათვალეთ რამდენი # სიმბოლოს გამოჩენაა chirp-ში
(მნიშვნელოვანი ინდიკატორი ზედმეტი hashtag-ებისთვის, რომლებსაც უყვართ სპამერებს 😄).
ააშენეთ კლასიფიკაციის მოდელი, რომელიც პრედიქტებს ალბათობას, რომ chirp
იყოს პრობლემური (p ∈ [0,1]) test-ის ყოველი რიგისთვის.
შეფასება ხდება ROC curve-ისა და AUC (Area Under the ROC Curve)-ის გამოყენებით.
Subtasks 1–2 ფასდება ზუსტად (შედარებით).
ფაილი submission.csv უნდა შეიცავდეს 3 ხაზს test-ის ყოველი რიგისთვის,
რომლებიც შეესაბამება 3 subtask-ს.
სტრუქტურა:
subtaskID,datapointID,answerსადაც:
სადაც:
id-ის მნიშვნელობა# სიმბოლოს გამოჩენების რაოდენობა (მთელი რიცხვი)id = 25758-ისთვის:subtaskID,datapointID,answer1,25758,212,25758,03,25758,0.083Subtask 3-ისთვის, შეფასება ხდება ROC AUC (Area Under the ROC Curve)-ის გამოყენებით.
ეს არის უნიკალური ზომა, რომელიც აჯამებს კლასიფიკატორის შესრულებას
ყველა შესაძლო გადაწყვეტილების ზღვრისთვის.
იხატება ROC მრუდი, რომელიც წარმოადგენს:
მრუდის ქვეშ არეალი (AUC) ითვლება ტრაპეციების წესის გამოყენებით:
ქულის ინტერპრეტაცია: