ამოცანა #304
ავტორი:IOAI 2026 Organizing Team
სირთულე
თქვენი საუკეთესო შედეგი
არ არის
თქვენ ავარჯიშებთ მიწოდების რობოტს ურბანულ რუკაზე, რომელიც 8 × 8 უჯრისგან შედგება. თითოეულ ეპიზოდში რობოტი იწყებს თავისუფალი უჯრიდან, მიდის დეპომდე, სადაც ამანათია, იღებს მას, გადაადგილდება სხვა დეპომდე — დანიშნულების ადგილამდე — და აწვდის მას. თითოეული რუკა შეიცავს ექვს დეპოს და რვა დაბლოკილ უჯრას.
მიზანია რობოტის ქცევის შესწავლა განზრახ მცირე რაოდენობის ექსპერტული დემონსტრაციებიდან. ეს არის ქცევის კლონირების ამოცანა: თქვენ წვრთნით მოდელს დაკვირვება/მოქმედების მაგალითებზე და შემდეგ ნაბიჯ-ნაბიჯ უშვებთ მას ახალ ეპიზოდებში.
დეპოები ინდექსირებულია 0..5-ით და მონიშნულია A..F-ით. ეპიზოდი წარმატებით სრულდება, როდესაც რობოტი ამანათის ტარებისას დანიშნულების ადგილზე ასრულებს მართებულ მოქმედებას dropoff. დაშვებულია მაქსიმუმ 120 actions.
| ID | მოქმედება |
|---|---|
| 0 | სამხრეთი |
| 1 | ჩრდილოეთი |
| 2 | აღმოსავლეთი |
| 3 | დასავლეთი |
| 4 | ამანათის აღება (pickup) |
| 5 | ამანათის მიწოდება (dropoff) |
კედელში ან რუკის გარეთ გადაადგილება რობოტის მდებარეობას არ ცვლის, მაგრამ ერთ ნაბიჯს ხარჯავს. pickup წარმატებულია მხოლოდ ამანათის დეპოში, როდესაც რობოტს ამანათი ჯერ არ გადააქვს. dropoff წარმატებულია მხოლოდ დანიშნულების ადგილზე, როდესაც რობოტს ამანათი გადააქვს. არამართებული pickup ან dropoff state-ს არ ცვლის და ერთ ნაბიჯს ხარჯავს.
თითოეული სასწავლო დაკვირვება შეიცავს:
grid: float32 ტენზორს ფორმით (6, 8, 8);vector: 13 ნორმალიზებულ რიცხვით მნიშვნელობას;action_mask: ექვს ბულის მნიშვნელობას, რომლებიც მართებულ actions-ს მიუთითებს;state: (row, column, package_field, destination).grid ტენზორის არხები წარმოადგენს:
vector თანმიმდევრობით შეიცავს: რობოტის ნორმალიზებულ მწკრივსა და სვეტს, ამანათის ველს, დანიშნულების ადგილს, ტარების ინდიკატორს, მიმდინარე სამიზნის მწკრივსა და სვეტს, სამიზნესთან მიმართებით სხვაობებს, შემდეგ კი დაბლოკილი მოძრაობის ოთხ ინდიკატორს თანმიმდევრობით სამხრეთი, ჩრდილოეთი, აღმოსავლეთი, დასავლეთი.
საჯარო მონაცემთა ნაკრები შეიცავს:
პლატფორმის პაკეტი Python pickle ფაილების ნაცვლად იყენებს JSON-სა და უსაფრთხო NumPy მასივებს. ზუსტი სახელებისა და ჩატვირთვის კოდისთვის იხილეთ starter_kit.py. NumPy ფაილები ჩატვირთეთ allow_pickle=False-ის გამოყენებით.
თითოეული layout_id საზიაროა ოთხი ეპიზოდისთვის. უნიკალური გასაღები ყოველთვის არის:
(layout_id, episode_seed)გაწვრთენით დეტერმინისტული მოდელი, რომელიც მიმდინარე დაკვირვებიდან მომდევნო მოქმედებას წინასწარმეტყველებს. გაუშვით მოდელი სრულ ეპიზოდებზე და თითოეული სატესტო სცენარისთვის შექმენით მოქმედებების ერთი მიმდევრობა.
თქვენ შეგიძლიათ მოწოდებული დემონსტრაციები წვრთნისთვის გამოიყენოთ. თქვენ არ გაქვთ ვალიდაციის ან სატესტო ნაკრებებისთვის ექსპერტული მონიშვნების მოპოვების უფლება და არც ძიების, დაგეგმვის ან სხვა ექსპერტული მოდელის საშუალებით დამატებითი ექსპერტული დემონსტრაციების შექმნის უფლება. წესებზე დაფუძნებული ან აშკარად ხისტად კოდირებული ამოხსნები შეიძლება სამეცნიერო კომიტეტმა განიხილოს. ორგანიზატორებმა შეიძლება მოითხოვონ წარდგენის შესაქმნელად გამოყენებული notebook ან საწყისი კოდი.
წარადგინეთ ZIP არქივი სახელად predictions.zip, რომელიც თავის ძირეულ საქაღალდეში ზუსტად ერთ ფაილს შეიცავს: predictions.json.
ფაილი უნდა შეიცავდეს JSON მასივს ზუსტად 1,600 ობიექტით, თითოეულ სატესტო ეპიზოდზე თითო ობიექტს:
[ {"layout_id":"test_0000","episode_seed":300000,"actions":[1,1,2,4,0,5]}]მოთხოვნები:
(layout_id, episode_seed)-ის გამოყენებით უკავშირდება და არა მწკრივების რიგითობით;actions უნდა იყოს 0-დან 5-მდე მთელი რიცხვების — არა ბულის მნიშვნელობების — JSON სია;არამართებული არქივები ან არასრული წარდგენები უარყოფილია.
მეტრიკა არის ეპიზოდების წარმატების მაჩვენებელი:
SR = successful deliveries / evaluated episodesscore = 100 × SRამანათამდე მისვლისთვის, სამიზნესთან მიახლოებისთვის ან ნაკლები ნაბიჯის გამოყენებისთვის ნაწილობრივი ქულა არ გაიცემა.
პლატფორმის ლიდერთა ცხრილისთვის სატესტო რუკები დეტერმინისტულად იყოფა:
შეჯიბრის განმავლობაში ნაჩვენებია ნაწილობრივი ქულა, ხოლო საბოლოო ლიდერთა ცხრილი სრულ ნაკრებს იყენებს. ორ ქვესიმრავლესთან კუთვნილება საჯარო მონაცემებში არ შედის. ნაბიჯების საშუალო რაოდენობა და pickup/dropoff-ის არამართებული მცდელობები შეიძლება გამოჩნდეს შემფასებლის ჟურნალებში, მაგრამ ისინი ქულაზე არ მოქმედებს.
ადაპტირებულია „რობოტული მიწოდების აკადემია: მოსამზადებელი პროგრამა“ (IOAI 2026, Home Task 2)-ის მიხედვით. მონაცემების უსაფრთხო წარმოდგენა, ვალიდაციის წესები, ლიდერთა ცხრილის დაყოფა და შემფასებელი MLCompete პლატფორმისთვისაა ადაპტირებული.