სირთულე
თქვენი საუკეთესო შედეგი
არ არის
დეკემბრის თვეში, დიდი და მშვიდი ფანტლებით, როდესაც სოფელი ჯერ კიდევ იყიდებოდა დამწვარი ხისა და ბეღლებიდან ახლად ამოღებული თივის სუნით, ქვეყნის შუაგულში იხსნებოდა კურდღლების ეროვნული გამოფენის კარიბჭე. გათბობილ დარბაზებში, ყვითელი შუქების ქვეშ ბრწყინავდნენ, ქვეყნის ყველა კუთხიდან მოსული მეცხოველეები იმედით მოჰყავდათ თავიანთი ყველაზე ლამაზი და კარგად მოვლილი ცხოველები.

კურდღლების სამი დიდი ჯიშის ნიმუშები (თითოეული კარგად ჩამოყალიბებული გარეგნობითა და ჩვევებით) კვლავ უნდა შეხვედროდნენ ერთსა და იმავე ადგილას.
ყოველი ცხოველი იღებდა ფირფიტას ID-ით, ხოლო ტყავში შებმულ სქელ რეგისტრში ჩაიწერებოდა ყველა ნიშანი, რაც მას სხვებისგან განასხვავებდა:
სქესი, წონა, ყურების სიგრძე, ჩამოშვებული ყურები თუ არა, ბეწვის ფერი, ასაკი, ბეწვის ტიპი და ხარისხი, სხეულის ფორმა, აქვს თუ არა ყელქვეშა, ასევე ჯანმრთელობის მდგომარეობა.
ეს იყო ორგანიზატორების წესი, რომ სრული მოწმობა შეენახათ დარბაზში შესული ყოველი ბეწვიანი სულის შესახებ.
ორგანიზატორებს სურთ იცოდნენ, რამდენ მდედრს ჰქონდა გამოფენაზე მოყვანილთაგან ჩამოშვებული ყურები და ატარებდა ჰავანას კეთილშობილურ ნიუანსს. შედეგი უნდა განსაზღვროთ ტესტური მონაცემების ნაკრების საფუძველზე (test_data.csv).
არაფერი რთული, უბრალოდ უნდა განახორციელოთ ყურადღებიანი ძიება რეგისტრებში, რომ მისცეთ მათ ეს პასუხი.
![]() | ![]() | ![]() |
ცივ დილას, როდესაც სუნთქვის ორთქლი ჯერ კიდევ იმაღლებოდა დარბაზში, ორგანიზატორებმა აღმოაჩინეს, რომ ოფიციალური რეგისტრიდან მნიშვნელოვანი გვერდი გაქრა.
ყოველი კურდღლის ჯიში, ისეთი ყურადღებით ჩაწერილი სხვა წლებში, აღარ იპოვებოდა არსად.
მოყვანილი იყო სამი განსხვავებული ჯიშის ნიმუშები, ეს ზუსტად იცოდნენ, მაგრამ მათ პირდაპირ იდენტიფიცირების ნიშნები გაქრა.
ისინი, ვინც კარგად იცნობდნენ კურდღლებს, სთხოვეს მოთმინებით დაკვირვებოდნენ ყველა ნიმუშს და იდენტიფიცირება გაეკეთებინათ სამი ბუნებრივი ჯგუფისა, მხოლოდ ჩაწერილი თვისებების გამოყენებით: მსგავსებები, განსხვავებები, მკაფიო საზღვრები, ზონები, სადაც ცხოველები ჩანდნენ ახლოს ან შორს გარეგნობით. შედეგი უნდა განსაზღვროთ ტესტური მონაცემების ნაკრების საფუძველზე (test_data.csv).
ჯიშებად დაყოფის რამდენად კარგ შესაბამისობას ვაფასებთ Adjusted Rand Index (ARI)-ით, რომელიც ზომავს ორ დაყოფას შორის მსგავსებას, რეგულირებას უკეთებს შემთხვევითი შესაბამისობისთვის.
ორი დაყოფისთვის ARI კოეფიციენტი განისაზღვრება როგორც:
სადაც:
RI წარმოადგენს რანდის ინდექსს ორ დაყოფას შორის;E[RI] არის რანდის ინდექსის მოსალოდნელი მნიშვნელობა შემთხვევითი დაყოფებისთვის.თუ მიღებული რიცხვი 1-ის ახლოსაა, ნიშნავს, რომ ჯიშებად დაყოფა გაკეთდა უნარით და ჯიშების მახასიათებლებს შორის საზღვრები სწორად იქნა იდენტიფიცირებული. გამოფენის ორგანიზატორები ძალიან მომთხოვნები არიან და ამ subtask-ისთვის მაქსიმალურ ქულას იძლევიან მხოლოდ იმ შემთხვევაში, თუ შეფასების მეტრიკისთვის მიღებული მნიშვნელობა არის 1.
იმ დეკემბერში მონაწილეთა რიცხვი იმდენად დიდი იყო, რომ მსაჯები, რამდენადაც ეცადნენ, ვერ შეძლეს ყველა ცხოველის განსჯა.
მხოლოდ მათი ნაწილი მიიღო ჟიურის ქულა, 0-დან 100-მდე.
0 ნიშნავს, რომ ნიმუში დისკვალიფიცირდა100 ნიშნავს, რომ ნიმუში ისეთია, რომ შეიძლება ჩემპიონად გამოცხადდესდანარჩენი კურდღლებისთვის, ჯერ კიდევ მონიშნული არ არიან, უნდა ეპოვათ გზა ქულის გამოცნობისა, რომელსაც მიიღებდნენ.
მიზნად ისახავდნენ სისტემას, რომელსაც შეეძლო გაეგო კავშირები უკვე შეფასებულ კურდღლებსა და ქულის გარეშე დარჩენილებს შორის, ისე, რომ შეფასებები რაც შეიძლება ახლოს ყოფილიყო იმისა, რასაც მსაჯები იტყოდნენ.
რაც უფრო მცირეა განსხვავებები, მით უფრო გამოცდილად და შესაფერისად ითვლება სისტემა ცხოველების დიდი რაოდენობით გადატვირთული ადამიანების დასახმარებლად.
თქვენი ამოცანაა განავითაროთ ქულების პროგნოზირების ავტომატური სისტემა test_data.csv-ში ჩართული ნიმუშებისთვის.
მოდელის შესრულების შესაფასებლად ვიყენებთ MSE (Mean Squared Error) — საშუალო კვადრატულ შეცდომას. ეს ზომავს საშუალო კვადრატულ განსხვავებას რეალურ და პროგნოზირებულ მნიშვნელობებს შორის.
ფორმულა არის:
სადაც:
y_i არის i ნიმუშის რეალური ქულა,y^_i არის მოდელის მიერ პროგნოზირებული ქულა,n არის ტესტური ნაკრების ნიმუშების საერთო რაოდენობა.MSE-ის უფრო მცირე მნიშვნელობები მიუთითებს უკეთეს შესრულებაზე. რაც უფრო ახლოსაა პროგნოზირებული მნიშვნელობები რეალურთან, მით უფრო მცირე იქნება შეცდომა.
მიღებული ქულის ქულებად გარდაქმნისთვის ვიყენებთ მარტივ წესს, რომელიც ორ ზღვარზეა დაფუძნებული:
საბოლოო შედეგი უნდა იყოს CSV ფაილი სახელწოდებით output.csv, რომელიც უნდა შეიცავდეს ზუსტად 3 სვეტს:
subtaskID - წარმოადგენს subtask-ის ნომერს (1, 2, 3)datapointID - რომელიც ეხება dataset-ის ID სვეტსanswer - შესაბამისი პასუხი მონაცემის წერტილისთვის შესაბამისი subtask-ისთვისშენიშვნა: Subtask 1-ისთვის, რომელშიც მთელი ტესტური მონაცემების ნაკრებისთვის ერთი პასუხია საჭირო, აჩვენეთ ერთი ხაზი, რომლის datapointID იყოს 1.
გთხოვთ ჩაერთოთ და დაეხმაროთ კურდღლების ეროვნული გამოფენის ორგანიზატორებს: ამბავი ვნებისა და შესრულების, მეცხოველეებს შორის გაგების, ჯიშებს შორის მსგავსებებისა და განსხვავებების შესახებ და ცხოველების სამყაროს იმ მოთმინებით ნახვის მცდელობის შესახებ, რომელიც მხოლოდ კარგ მეცხოველეს შეუძლია ღვთისმშობლობის წინ.