ამოცანა #39
ავტორი:Mihai Nan
სირთულე
თქვენი საუკეთესო შედეგი
არ არის
დიდი სამეფოს ბიბლიოთეკაში, არქივისტები უფრო და უფრო რთულ ამოცანას აწყდებიან:
ათასობით ხელნაწერი, პარგამენტი და ძველი ქრონიკა უნდა მოეწყოს, შეედაროს და ინდექსირდეს.
მათ დასახმარებლად, წინაპრებმა შექმნეს ლეგენდარული მექანიზმი: მსგავსების ორაკული. ეს არის
მოწყობილობა, რომელსაც შეუძლია განსაზღვროს, შესანიშნავი სიზუსტით, რამდენად ჰგავს
ერთმანეთს ტექსტის ორი ფრაგმენტი, აბრუნებს ქულას 0-დან 5-მდე.
მაგრამ მექანიზმი დროთა განმავლობაში დაზიანდა, და არქივისტთა დიდმა საბჭომ გადაწყვიტა, რომ საჭიროა
თანამედროვე ვერსია, აშენებული მანქანური სწავლების გამოყენებით.
ამისთვის, შენს განკარგულებაში მოგეცა ორი ფაილი:
train.csv - ხელით ანოტირებული პარგამენტები მწერლების მიერtest.csv - ახალი წყვილები, რომლებიც უნდა გაანალიზოს შენმა გადაწყვეტილებამშენი ამოცანაა აღადგინო ორაკული ანალიზების სერიისა და საბოლოო პრედიქციული მოდელის მეშვეობით.
train.csv და test.csv ფაილების თითოეული რიგი წარმოადგენს წინადადებების წყვილს:
საბოლოო მიზანია score-ის პრედიქცია test.csv-ის თითოეული რიგისთვის.
პირველი ქვეამოცანებისთვის, უნდა გაანალიზოთ train.csv და test.csv-ში მოცემული მონაცემები
და ამოიღოთ სხვადასხვა შესაბამისი ინფორმაცია ტესტის წინადადებების შესახებ.
გამოთვალეთ თითოეული წინადადების სიგრძე (sentence1 და sentence2) ტესტის ნაკრების თითოეული რიგისთვის
და მონიშნეთ წყვილი საშუალო სიგრძის მიხედვით:
Short თუ საშუალო < 50Medium თუ 50 ≤ საშუალო < 100Long თუ საშუალო ≥ 100ტესტის თითოეული რიგისთვის, გამოთვალეთ სიტყვების რაოდენობა თითოეულ წინადადებაში (sentence1 და sentence2) და განსაზღვრეთ მთლიანი რაოდენობა ფორმულის მიხედვით:
მთლიანი_რაოდენობა = სიტყვების_რაოდენობა(sentence1) + სიტყვების_რაოდენობა(sentence2)განსაზღვრეთ აბსოლუტური განსხვავება sentence1-ის სიგრძესა და sentence2-ის სიგრძეს შორის
ტესტის თითოეული რიგისთვის.
სხვა სიტყვებით, თითოეული რიგისთვის უნდა გამოვთვალოთ:
|სიმბოლოების_რაოდენობა(sentence1) - სიმბოლოების_რაოდენობა(sentence2)|ააშენეთ მანქანური სწავლების მოდელი, რომელსაც შეუძლია რიცხვითი მნიშვნელობის score-ის პრედიქცია
test.csv-ის თითოეული რიგისთვის.
საბოლოო შეფასება გაკეთდება MAE (Mean Absolute Error)-ის გამოყენებით, რომელიც ითვლება ასე:
ქვეამოცანა 4-ის მეტრიკაა:
ქვეამოცანები 1-3-ისთვის, პასუხები ფასდება ზუსტად.
submission.csv ფაილი უნდა შეიცავდეს 4 ხაზს ტესტის თითოეული რიგისთვის,
რომლებიც შეესაბამება 4 ქვეამოცანას.
სტრუქტურა:
subtaskID datapointID answerსვეტების მნიშვნელობა:
subtaskID – რიცხვი 1-დან 4-მდე
datapointID – sampleID ტესტიდან
answer – შედეგი:
Short / Medium / LongsampleID = 1714-ისთვის:subtaskID datapointID answer1 1714 Medium2 1714 153 1714 34 1714 3.74წარმატებები! არქივისტთა დიდი საბჭო თქვენზე ამყარებს იმედებს მსგავსების ორაკულის აღორძინებისთვის! 🧙♂️