Задатак #39
Аутор:Mihai Nan
Тежина
Твој најбољи резултат
Н/Д
U Biblioteci Velikog Kraljevstva, arhivisti se suočavaju sa sve težim zadatkom:
hiljade rukopisa, pergamenata i starih hronika mora da bude organizovano, poređeno i indeksirano.
Da bi im pomogli, preci su stvorili legendarni mehanizam: Orakul sličnosti. Ovo je
uređaj sposoban da utvrdi, sa izuzetnom preciznošću, koliko su slična
dva fragmenta teksta, vraćajući skor između 0 i 5.
Ali mehanizam se degradirao tokom vremena, a Veliki Savet Arhivista je odlučio da je potrebna
moderna verzija, izgrađena koristeći mašinsko učenje.
Za ovo su vam stavljena na raspolaganje dva fajla:
train.csv - pergamenti ručno anotirani od strane pisaratest.csv - novi parovi koji treba da budu analizirani od strane vašeg rešenjaVaš zadatak je da rekonstruišete Orakul kroz seriju analiza i finalni prediktivni model.
Svaki red u fajlovima train.csv i test.csv predstavlja par rečenica:
Finalni cilj je da predvidite score za svaki red iz test.csv.
Za prve podzadatke, treba da analizirate podatke date u train.csv i test.csv
i da izvučete različite relevantne informacije o rečenicama iz test skupa.
Izračunajte dužinu svake rečenice (sentence1 i sentence2) za svaki red iz test skupa
i etiketirajte par u zavisnosti od prosečne dužine:
Short ako je prosek < 50Medium ako je 50 ≤ prosek < 100Long ako je prosek ≥ 100Za svaki red iz test skupa, izračunajte broj reči u svakoj rečenici (sentence1 i sentence2) i odredite ukupan broj prema formuli:
ukupan_broj = br_reči(sentence1) + br_reči(sentence2)Ustanovite apsolutnu razliku između dužine sentence1 i dužine sentence2
za svaki red iz test skupa.
Drugim rečima, za svaki red treba da izračunamo:
|br_karaktera(sentence1) - br_karaktera(sentence2)|Izgradite model mašinskog učenja sposoban da predvidi numeričku vrednost score
za svaki red iz test.csv.
Finalna evaluacija će se vršiti koristeći MAE (Mean Absolute Error), izračunat ovako:
Metrika za Podzadatak 4 je:
Za podzadatke 1-3, odgovori se evaluiraju tačno.
Fajl submission.csv treba da sadrži po 4 linije za svaki red iz test skupa,
koje odgovaraju 4 podzadatka.
Struktura:
subtaskID datapointID answerZnačenje kolona:
subtaskID – broj između 1 i 4
datapointID – sampleID iz test skupa
answer – rezultat:
Short / Medium / LongsampleID = 1714:subtaskID datapointID answer1 1714 Medium2 1714 153 1714 34 1714 3.74Uspeh! Veliki Savet Arhivista polaže nade u vas za oživljavanje Orakula sličnosti! 🧙♂️