სირთულე
თქვენი საუკეთესო შედეგი
არ არის
ამ ამოცანის მიზანია ტექსტების იდენტიფიცირება და კლასიფიკაცია რეგიონალური თავისებურებების ან რუმინული ენის სტანდარტული ფორმის მიხედვით. მონაცემთა ნაკრები შეიცავს სხვადასხვა რეგიონიდან შეგროვებულ ტექსტურ ფრაგმენტებს.
| სვეტი | აღწერა |
|---|---|
| ID | თითოეული ტექსტური ფრაგმენტის უნიკალური იდენტიფიკატორი |
| text | ფრაზის უშუალო შინაარსი რუმინულ ენაზე |
| label | ტექსტის დიალექტის კლასიფიკაცია (სამიზნე სვეტი) |
შენიშვნა: სვეტი label (დიალექტი) ხელმისაწვდომია მხოლოდ საწვრთნელ მონაცემებში (train.csv). სამი შესაძლო კლასია: româna standard (სტანდარტული რუმინული), graiul moldovenesc (მოლდოვური კილო) და graiul bănățean (ბანატური კილო).
ტექსტების ნაწილი ამოღებულია იონ კრეანგას ნაწარმოებიდან "Cinci pâini". დათვალეთ სიტყვა "pâni"-ს (სიტყვა "pâini"-ს არქაული ფორმა) გამოჩენის ჯამური რაოდენობა train.csv და test.csv ფაილებში.
train.csv-ში გამოთვალეთ სასვენი ნიშნების საშუალო რაოდენობა graiul moldovenesc და graiul bănățean დიალექტების ტექსტებისთვის. დააბრუნეთ ამ ორ მნიშვნელობას შორის სხვაობის აბსოლუტური მნიშვნელობა (მოდული), დამრგვალებული 2 მეათედამდე.
test.csv-ის თითოეული სტრიქონისთვის დათვალეთ დიაკრიტიკული ნიშნების რაოდენობა ტექსტში. დიაკრიტიკულ ნიშნებად ითვლება სიმბოლოები: ă, â, î, ș, ț (და მათი შესაბამისი მთავრული ვარიანტები Ă, Â, Î, Ș, Ț).
ააგეთ მოდელი, რომელსაც შეეძლება სატესტო ფაილის ტექსტების სწორად კლასიფიცირება 3 კლასიდან ერთ-ერთში.
შეფასება ხდება პასუხის ზუსტი შემოწმებით. სწორი პასუხი = მაქსიმალური ქულა, არასწორი პასუხი = 0 ქულა.
შეფასება ხდება accuracy-ს მეშვეობით — სწორი პასუხების წილი მთლიან რაოდენობაში. ქულა პროპორციულია: accuracy 1.0 = 10 ქულა, accuracy 0.0 = 0 ქულა.
შეფასება ხდება F1-Macro მეტრიკის გამოყენებით.
წარსადგენი ფაილი უნდა იყოს CSV ფორმატში და შეიცავდეს შემდეგ სვეტებს:
1.ID სვეტის მნიშვნელობები test.csv-დან.subtaskID,datapointID,answer1,1,322,1,5.073,101,23,102,43,103,2...4,101,româna standard4,102,graiul moldovenesc4,103,graiul bănățean...შენიშვნა: ამ ამოცანის გადასაჭრელად არ არის აუცილებელი Transformer-ის ტიპის არქიტექტურების გამოყენება (მაგ: RoBERTa).