Naloga #39
Avtor:Mihai Nan
Težavnost
Vaš najboljši rezultat
N/A
V Knjižnici Velikega Kraljestva se arhivarji soočajo z vedno težjo nalogo:
tisoči rokopisov, pergamentov in starih kronik mora biti organiziranih, primerjanih in indeksiranih.
Da bi jim pomagali, so predniki ustvarili legendarni mehanizem: Orakelj podobnosti. To je
naprava, ki lahko z izjemno natančnostjo določi, kako podobna
sta dva odlomka besedila, in vrne oceno med 0 in 5.
Vendar se je mehanizem sčasoma pokvaril, in Veliki svet arhivarjev je odločil, da je potrebna
sodobna različica, zgrajena z uporabo strojnega učenja.
Za to so vam na voljo dve datoteki:
train.csv - pergamenti, ki so jih ročno označili pisarjitest.csv - novi pari, ki jih mora analizirati vaša rešitevVaša naloga je, da rekonstruirate Orakelj z vrsto analiz in končnim napovednim modelom.
Vsaka vrstica v datotekah train.csv in test.csv predstavlja par stavkov:
Končni cilj je napovedati score za vsako vrstico v test.csv.
Za prve podnaloge morate analizirati podatke, podane v train.csv in test.csv,
in izvleči različne relevantne informacije o stavkih iz testa.
Izračunajte dolžino vsakega stavka (sentence1 in sentence2) za vsako vrstico iz testnega nabora
in označite par glede na povprečno dolžino:
Short če je povprečje < 50Medium če je 50 ≤ povprečje < 100Long če je povprečje ≥ 100Za vsako vrstico iz testa izračunajte število besed v vsakem stavku (sentence1 in sentence2) in določite skupno število po formuli:
skupno_število = št_besed(sentence1) + št_besed(sentence2)Določite absolutno razliko med dolžino sentence1 in dolžino sentence2
za vsako vrstico iz testa.
Z drugimi besedami, za vsako vrstico moramo izračunati:
|št_znakov(sentence1) - št_znakov(sentence2)|Zgradite model strojnega učenja, ki lahko napove numerično vrednost score
za vsako vrstico v test.csv.
Končno vrednotenje se bo izvedlo z uporabo MAE (Mean Absolute Error), izračunanega takole:
Metrika za podnaloga 4 je:
Za podnaloge 1-3 se odgovori vrednotijo natančno.
Datoteka submission.csv mora vsebovati 4 vrstice za vsako vrstico iz testa,
ki ustrezajo 4 podnaloga.
Struktura:
subtaskID datapointID answerPomen stolpcev:
subtaskID – število med 1 in 4
datapointID – sampleID iz testa
answer – rezultat:
Short / Medium / LongsampleID = 1714:subtaskID datapointID answer1 1714 Medium2 1714 153 1714 34 1714 3.74Srečno! Veliki svet arhivarjev polaga svoje upanje vase za oživitev Oraklja podobnosti! 🧙♂️