Úloha #39
Autor:Mihai Nan
Obtížnost
Vaše nejlepší skóre
N/A
V Knihovně Velkého království se archiváři potýkají se stále obtížnějším úkolem:
tisíce rukopisů, pergamenů a starých kronik je třeba organizovat, porovnávat a indexovat.
Aby jim pomohli, předkové vytvořili legendární mechanismus: Orákulum podobnosti. Jedná se
o zařízení schopné stanovit s pozoruhodnou přesností, jak podobné
jsou dva textové fragmenty, a vrátit skóre mezi 0 a 5.
Ale mechanismus se časem zhoršil a Velká rada archivářů rozhodla, že je potřeba
moderní verze, postavená pomocí strojového učení.
K tomu máte k dispozici dva soubory:
train.csv - pergameny ručně anotované písařitest.csv - nové páry, které musí analyzovat vaše řešeníVaším úkolem je rekonstruovat Orákulum prostřednictvím série analýz a finálního prediktivního modelu.
Každý řádek v souborech train.csv a test.csv představuje pár vět:
Konečným cílem je předpovědět score pro každý řádek v test.csv.
Pro první podúkoly musíte analyzovat data poskytnutá v train.csv a test.csv
a extrahovat různé relevantní informace o větách z testu.
Vypočítejte délku každé věty (sentence1 a sentence2) pro každý řádek z testovací sady
a označte pár podle průměrné délky:
Short pokud průměr < 50Medium pokud 50 ≤ průměr < 100Long pokud průměr ≥ 100Pro každý řádek z testu vypočítejte počet slov v každé větě (sentence1 a sentence2) a určete celkový počet podle vzorce:
celkový_počet = počet_slov(sentence1) + počet_slov(sentence2)Stanovte absolutní rozdíl mezi délkou sentence1 a délkou sentence2
pro každý řádek z testu.
Jinými slovy, pro každý řádek musíme vypočítat:
|počet_znaků(sentence1) - počet_znaků(sentence2)|Sestavte model strojového učení schopný předpovědět numerickou hodnotu score
pro každý řádek z test.csv.
Finální hodnocení se provede pomocí MAE (Mean Absolute Error), vypočítané takto:
Metrika pro Podúkol 4 je:
Pro podúkoly 1-3 se odpovědi hodnotí přesně.
Soubor submission.csv musí obsahovat 4 řádky pro každý řádek z testu,
odpovídající 4 podúkolům.
Struktura:
subtaskID datapointID answerVýznam sloupců:
subtaskID – číslo mezi 1 a 4
datapointID – sampleID z testu
answer – výsledek:
Short / Medium / LongsampleID = 1714:subtaskID datapointID answer1 1714 Medium2 1714 153 1714 34 1714 3.74Hodně štěstí! Velká rada archivářů vkládá své naděje do vás pro oživení Orákula podobnosti! 🧙♂️