Zadatak #39
Autor:Mihai Nan
Težina
Vaš najbolji rezultat
N/D
U Biblioteci Velikog Kraljevstva, arhivisti se suočavaju s sve težim zadatkom:
tisuće rukopisa, pergamena i starih kronika treba organizirati, usporediti i indeksirati.
Da bi im pomogli, preci su stvorili legendarni mehanizam: Proročište sličnosti. To je
uređaj sposoban ustanoviti, s izuzetnom preciznošću, koliko su slična
dva fragmenta teksta, vraćajući rezultat između 0 i 5.
Ali mehanizam se degradirao tijekom vremena, pa je Veliko vijeće arhivista odlučilo da je potrebna
moderna verzija, izgrađena pomoću strojnog učenja.
Za to su vam stavljena na raspolaganje dva datoteke:
train.csv - pergameni ručno anotirani od pisaratest.csv - novi parovi koje treba analizirati vašim rješenjemVaš zadatak je rekonstruirati Proročište kroz niz analiza i konačni prediktivni model.
Svaki red u datotekama train.csv i test.csv predstavlja par rečenica:
Konačni cilj je predvidjeti score za svaki red u test.csv.
Za prve podzadatke, trebate analizirati podatke dane u train.csv i test.csv
i izvući različite relevantne informacije o rečenicama iz testa.
Izračunajte duljinu svake rečenice (sentence1 i sentence2) za svaki red iz test skupa
i označite par prema prosjećnoj duljini:
Short ako je prosjek < 50Medium ako je 50 ≤ prosjek < 100Long ako je prosjek ≥ 100Za svaki red iz testa, izračunajte broj riječi u svakoj rečenici (sentence1 i sentence2) i odredite ukupni broj prema formuli:
ukupni_broj = br_riječi(sentence1) + br_riječi(sentence2)Ustanovite apsolutnu razliku između duljine sentence1 i duljine sentence2
za svaki red iz testa.
Drugim riječima, za svaki red trebamo izračunati:
|br_znakova(sentence1) - br_znakova(sentence2)|Izgradite model strojnog učenja sposoban predvidjeti numeričku vrijednost score
za svaki red u test.csv.
Konačna evaluacija će se napraviti koristeći MAE (Mean Absolute Error), izračunat ovako:
Metrika za Podzadatak 4 je:
Za podzadatke 1-3, odgovori se evaluiraju točno.
Datoteka submission.csv mora sadržavati po 4 linije za svaki red iz testa,
odgovarajuće za 4 podzadatka.
Struktura:
subtaskID datapointID answerZnačenje stupaca:
subtaskID – broj između 1 i 4
datapointID – sampleID iz testa
answer – rezultat:
Short / Medium / LongsampleID = 1714:subtaskID datapointID answer1 1714 Medium2 1714 153 1714 34 1714 3.74Uspjeh! Veliko vijeće arhivista polaže svoje nade u vas za oživljavanje Proročišta sličnosti! 🧙♂️