სირთულე
თქვენი საუკეთესო შედეგი
არ არის
თქვენი კომპანია სურს დაიცვას მომხმარებლები არასასურველი ელფოსტებისგან (სპამი).
ამისთვის გადაწყდა ავტომატური სისტემის აშენება, რომელიც გამოავლენს
სპამ ელფოსტებს და გამოყოფს ლეგიტიმურისგან (არასპამი).
მიიღეთ ეტიკეტირებული ელფოსტების ნაკრები და უნდა ააშენოთ მოდელი
რომელსაც შეუძლია ახალი ელფოსტების კლასიფიკაცია.
თქვენთვის მოწოდებულია ორი ფაილი:
label (spam = 1 / nonspam = 0)მთავარი მიზანი: ელფოსტის სპამობის ალბათობის პროგნოზირება (მნიშვნელობა 0-სა და 1-ს შორის, სადაც 0 = დარწმუნებით არასპამი, 1 = დარწმუნებით სპამი).
თითოეული სტრიქონი წარმოადგენს ელფოსტას, შემდეგი ატრიბუტებით:
sample_id - უნიკალური იდენტიფიკატორიtext - ელფოსტის შინაარსიlabel - მხოლოდ train.csv-ში, 1 (სპამი)/ 0 (არასპამი)საბოლოო მიზანი: პროგნოზირება label test.csv-ის სტრიქონებისთვის.
პირველი ორი ქვეამოცანა ამოწმებს ელფოსტების მარტივ ანალიზს.
ბოლო ქვეამოცანა აფასებს კლასიფიკაციის მოდელს.
განსაზღვრეთ თითოეული ელფოსტის სიგრძე სიმბოლოების რაოდენობით.
ამ ქვეამოცანისთვის გამოიტანეთ მთელი რიცხვი.
დაითვალეთ რამდენი გამოჩენაა სიტყვა free-ს ელფოსტაში.
ააშენეთ კლასიფიკაციის მოდელი, რომელიც პროგნოზირებს ელფოსტის სპამობის ალბათობას (p ∈ [0,1]) ტესტის თითოეული სტრიქონისთვის.
შეფასება ხდება ROC curve-ისა და AUC (Area Under the ROC Curve)-ის გამოყენებით.
ქვეამოცანები 1–2 ფასდება ზუსტად (შედარებით).
ფაილი submission.csv უნდა შეიცავდეს 3 ხაზს ტესტის თითოეული სტრიქონისთვის,
რომლებიც შეესაბამება 3 ქვეამოცანას.
სტრუქტურა:
subtaskID, datapointID, answerსადაც:
sample_id-ის მნიშვნელობაfree-ს გამოჩენების რაოდენობა (მთელი რიცხვი)sample_id = 00042-სთვის:subtaskID,datapointID,answer1,00042,3422,00042,33,00042,0.742ქვეამოცანა 3-სთვის შეფასება ხდება ROC AUC (Area Under the ROC Curve)-ის გამოყენებით.
ეს არის ერთიანი ზომა, რომელიც ასინთეზებს კლასიფიკატორის მუშაობას ყველა შესაძლო გადაწყვეტილების ზღვრისთვის.

