Úloha #39
Autor:Mihai Nan
Obtiažnosť
Vaše najlepšie skóre
N/A
V Knižnici Veľkého kráľovstva sa archivári stretávajú s čoraz ťažšou úlohou:
tisíce rukopisov, pergamenov a starých kroník treba organizovať, porovnávať a indexovať.
Aby im pomohli, predkovia vytvorili legendárny mechanizmus: Orákulum podobnosti. Toto je
zariadenie schopné stanoviť s pozoruhodnou presnosťou, ako podobné
sú dva fragmenty textu, pričom vracia skóre medzi 0 a 5.
Ale mechanizmus sa časom degradoval a Veľká rada archivárskych úradníkov rozhodla, že je potrebná
moderná verzia, postavená pomocou strojového učenia.
Na to máš k dispozícii dva súbory:
train.csv - pergameny ručne anotované písarmitest.csv - nové páry, ktoré musí analyzovať tvoje riešenieTvojou úlohou je rekonštruovať Orákulum prostredníctvom série analýz a finálneho prediktívneho modelu.
Každý riadok v súboroch train.csv a test.csv predstavuje pár viet:
Konečným cieľom je predpovedať score pre každý riadok v test.csv.
Pre prvé podúlohy musíte analyzovať údaje poskytnuté v train.csv a test.csv
a extrahovať rôzne relevantné informácie o vetách z testu.
Vypočítajte dĺžku každej vety (sentence1 a sentence2) pre každý riadok z testovacej sady
a označte pár podľa priemernej dĺžky:
Short ak priemer < 50Medium ak 50 ≤ priemer < 100Long ak priemer ≥ 100Pre každý riadok z testu vypočítajte počet slov v každej vete (sentence1 a sentence2) a určte celkový počet podľa vzorca:
celkový_počet = počet_slov(sentence1) + počet_slov(sentence2)Stanovte absolútny rozdiel medzi dĺžkou sentence1 a dĺžkou sentence2
pre každý riadok z testu.
Inými slovami, pre každý riadok musíme vypočítať:
|počet_znakov(sentence1) - počet_znakov(sentence2)|Vytvorte model strojového učenia schopný predpovedať numerickú hodnotu score
pre každý riadok z test.csv.
Finálne hodnotenie sa bude robiť pomocou MAE (Mean Absolute Error), vypočítané takto:
Metrika pre Podúlohu 4 je:
Pre podúlohy 1-3 sa odpovede hodnotia presne.
Súbor submission.csv musí obsahovať 4 riadky pre každý riadok z testu,
zodpovedajúce 4 podúlohám.
Štruktúra:
subtaskID datapointID answerVýznam stĺpcov:
subtaskID – číslo medzi 1 a 4
datapointID – sampleID z testu
answer – výsledok:
Short / Medium / LongsampleID = 1714:subtaskID datapointID answer1 1714 Medium2 1714 153 1714 34 1714 3.74Úspech! Veľká rada archivárskych úradníkov vkladá svoje nádeje do vás na oživenie Orákula podobnosti! 🧙♂️