სირთულე
თქვენი საუკეთესო შედეგი
არ არის
საერთაშორისო საინფორმაციო სააგენტოს რედაქცია ყოველდღიურად მართავს ათასობით სტატიას სხვადასხვა სფეროდან: ეკონომიკა, პოლიტიკა, მეცნიერება, ტექნოლოგია და გარემო. ინფორმაციის სწრაფად დაარქივებისა და გავრცელების მიზნით, თითოეული სტატია უნდა მოექცეს თემატურ კატეგორიაში.
ტექნიკური ხარვეზის გამო, ზოგიერთი ბოლოდროინდელი სტატიის ეტიკეტები დაიკარგა. რედაქცია შენს დახმარებას ითხოვს ინტელექტუალური სისტემის ასაშენებლად, რომელსაც შეეძლება ავტომატურად კლასიფიცირება სიახლეების სტატიების მათი შინაარსის საფუძველზე.
მოცემულია ორი შესავალი ფაილი:
train.csv – შეიცავს სიახლეების სტატიებს, რომელთა კატეგორია ცნობილიაtest.csv – შეიცავს სიახლეების სტატიებს კატეგორიის გარეშეთითოეული სტატია იდენტიფიცირებულია უნიკალური id-ით და აქვს მიბმული ტექსტი.
train.csv-ის მონაცემების გამოყენებით, უნდა ააშენო კლასიფიკაციის მოდელი, რომელიც პროგნოზირებს ეტიკეტს (label) test.csv-ის თითოეული სტატიისთვის.
შედეგი შეინახება submission.csv ფაილში.
train.csvშეიცავს შემდეგ სვეტებს:
id – სტატიის უნიკალური იდენტიფიკატორი (string, მაგ. 000001)text – სტატიის შინაარსიlabel – სტატიის კატეგორია (მთელი რიცხვი)მაგალითი:
id,text,label000001,"Wall St. Bears Claw Back Into the Black (Reuters)...",2000002,"Carlyle Looks Toward Commercial Aerospace (Reuters)...",2000003,"Oil and Economy Cloud Stocks' Outlook (Reuters)...",2test.csvშეიცავს შემდეგ სვეტებს:
id – უნიკალური იდენტიფიკატორიtext – სტატიის შინაარსიმაგალითი:
id,text120001,"Fears for T N pension after talks Unions represent..."120002,"The Race is On: Second Private Team Sets Launch..."120003,"Ky. Company Wins Grant to Study Peptides (AP)..."submission.csvწარდგენისთვის გენერირებული ფაილი უნდა იყოს csv ფორმატში და შეიცავდეს შემდეგს:
id – სტატიის იდენტიფიკატორიlabel – პროგნოზირებული კატეგორიამაგალითი:
id,label120001,2120002,3120003,3train.csv-დან.პროგნოზები შედარდება რეალურ ეტიკეტებთან და გამოითვლება სიზუსტე:
accuracy = (სწორი_პროგნოზების_რაოდენობა / მთლიანი_პროგნოზების_რაოდენობა)საბოლოო ქულა გამოითვლება მიღებული სიზუსტის საფუძველზე შემდეგი წესების გამოყენებით: