Feladat #304
Szerző:IOAI 2026 Organizing Team
Nehézség
Az Ön legjobb eredménye
N/A
Önök egy kézbesítőrobotot tanítanak be egy 8 × 8 cellából álló városi térképen. A robot minden epizódban egy szabad celláról indul, eléri a raktárt, ahol a csomag található, felveszi azt, elmegy egy másik raktárhoz — a célállomáshoz —, és kézbesíti. Minden térkép hat raktárt és nyolc blokkolt cellát tartalmaz.
A cél a robot viselkedésének megtanulása szándékosan kevés szakértői demonstrációból. Ez egy viselkedésklónozási feladat: egy modellt tanítanak be megfigyelés/akció példákon, majd lépésről lépésre futtatják új epizódokon.
A raktárak indexei 0..5, címkéik pedig A..F. Egy epizód akkor ér véget sikeresen, amikor a robot a csomagot szállítva érvényes dropoff akciót hajt végre a célállomáson. Legfeljebb 120 actions engedélyezett.
| ID | Akció |
|---|---|
| 0 | dél |
| 1 | észak |
| 2 | kelet |
| 3 | nyugat |
| 4 | csomag felvétele (pickup) |
| 5 | csomag kézbesítése (dropoff) |
A falba vagy a térképen kívülre történő mozgás nem változtatja meg a robot helyzetét, de egy lépést felhasznál. A pickup csak a csomag raktáránál sikeres, amikor a robot még nem szállítja a csomagot. A dropoff csak a célállomáson sikeres, amikor a robot szállítja a csomagot. Az érvénytelen pickup vagy dropoff nem változtatja meg a state-et, és egy lépést felhasznál.
Minden tanítási megfigyelés a következőket tartalmazza:
grid: egy float32 tenzor (6, 8, 8) alakkal;vector: 13 normalizált numerikus érték;action_mask: hat logikai érték, amelyek az érvényes actions-t jelzik;state: (row, column, package_field, destination).A grid tenzor csatornái a következőket ábrázolják:
A vector sorrendben a következőket tartalmazza: a robot normalizált sora és oszlopa, a csomagmező, a célállomás, a szállítási jelző, az aktuális cél sora és oszlopa, a céltól való eltérések, majd négy blokkoltmozgás-jelző dél, észak, kelet, nyugat sorrendben.
A nyilvános adathalmaz a következőket tartalmazza:
A platformcsomag Python pickle-fájlok helyett JSON-t és biztonságos NumPy-tömböket használ. A pontos neveket és a betöltési kódot a starter_kit.py tartalmazza. A NumPy-fájlokat allow_pickle=False használatával töltsék be.
Minden layout_id négy epizódhoz tartozik. Az egyedi kulcs mindig:
(layout_id, episode_seed)Tanítsanak be egy determinisztikus modellt, amely az aktuális megfigyelésből előrejelzi a következő akciót. Futtassák a modellt teljes epizódokon, és minden tesztforgatókönyvhöz hozzanak létre egy akciósorozatot.
A megadott demonstrációkat felhasználhatják a betanításhoz. Nem szerezhetnek szakértői címkéket a validációs vagy tesztadathalmazokhoz, és nem hozhatnak létre további szakértői demonstrációkat kereséssel, tervezéssel vagy más szakértői modellel. A szabályalapú vagy kifejezetten mereven kódolt megoldásokat a Tudományos Bizottság felülvizsgálhatja. A szervezők kérhetik a beküldés létrehozásához használt notebookot vagy forráskódot.
Egy predictions.zip nevű ZIP-archívumot küldjenek be, amelynek gyökerében pontosan egy fájl található: predictions.json.
A fájlnak pontosan 1,600 objektumot tartalmazó JSON-tömbnek kell lennie, minden tesztepizódhoz egy objektummal:
[ {"layout_id":"test_0000","episode_seed":300000,"actions":[1,1,2,4,0,5]}]Követelmények:
(layout_id, episode_seed) használatával történik, nem a sorok sorrendje alapján;actions értékének 0 és 5 közötti egész számokból — nem logikai értékekből — álló JSON-listának kell lennie;Az érvénytelen archívumokat vagy hiányos beküldéseket elutasítják.
A metrika az epizódok sikerességi aránya:
SR = successful deliveries / evaluated episodesscore = 100 × SRNem jár részpontszám a csomag eléréséért, a célhoz való közeledésért vagy kevesebb lépés használatáért.
A platform ranglistájához a teszttérképek determinisztikusan vannak felosztva:
A verseny során a részleges pontszám jelenik meg, míg a végleges ranglista a teljes halmazt használja. A két részhalmazhoz való tartozás nem szerepel a nyilvános adatokban. Az átlagos lépésszám és az érvénytelen pickup-/dropoff-kísérletek megjelenhetnek az értékelő naplóiban, de nem befolyásolják a pontszámot.
Az „Robotkézbesítési Akadémia: előkészítő program” (IOAI 2026, Home Task 2) alapján adaptálva. A biztonságos adatreprezentáció, a validációs szabályok, a ranglista felosztása és az értékelő a MLCompete platformhoz készült adaptációk.