Užduotis #39
Autorius:Mihai Nan
Sudėtingumas
Jūsų geriausias rezultatas
Nepasiekiama
Didžiosios Karalystės bibliotekoje archyvariai susiduria su vis sunkesne užduotimi:
tūkstančiai rankraščių, pergamentų ir senųjų kronikų turi būti organizuojami, lyginami ir indeksuojami.
Kad jiems padėtų, protėviai sukūrė legendinį mechanizmą: Panašumo orakulą. Tai yra
įrenginys, galintis nustatyti, su nepaprastu tikslumu, kiek panašūs
yra du teksto fragmentai, grąžindamas balą nuo 0 iki 5.
Tačiau mechanizmas laikui bėgant pablogėjo, ir Didžioji Archyvarių Taryba nusprendė, kad reikia
šiuolaikinės versijos, sukurtos naudojant mašininį mokymąsi.
Tam tau pateikti du failai:
train.csv - pergamentai, rankiniu būdu anotuoti rašytojųtest.csv - naujos poros, kurias turi išanalizuoti tavo sprendimasTavo užduotis yra atkurti Orakulą per eilę analizių ir galutinį prognozuojantį modelį.
Kiekviena eilutė iš failų train.csv ir test.csv reprezentuoja sakinių porą:
Galutinis tikslas yra prognozuoti score kiekvienai eilutei iš test.csv.
Pirmoms užduotims reikia išanalizuoti duomenis, pateiktus train.csv ir test.csv
ir išgauti įvairią aktualią informaciją apie sakinius iš testo.
Apskaičiuokite kiekvieno sakinio (sentence1 ir sentence2) ilgį kiekvienai eilutei iš testo rinkinio
ir pažymėkite porą pagal vidutinį ilgį:
Short jei vidurkis < 50Medium jei 50 ≤ vidurkis < 100Long jei vidurkis ≥ 100Kiekvienai eilutei iš testo, apskaičiuokite žodžių skaičių kiekviename sakinyje (sentence1 ir sentence2) ir nustatykite bendrą skaičių pagal formulę:
bendras_skaičius = žodžių_sk(sentence1) + žodžių_sk(sentence2)Nustatykite absoliutų skirtumą tarp sentence1 ir sentence2 ilgio
kiekvienai eilutei iš testo.
Kitaip tariant, kiekvienai eilutei turime apskaičiuoti:
|simbolių_sk(sentence1) - simbolių_sk(sentence2)|Sukurkite mašininio mokymosi modelį, galintį prognozuoti skaitinę reikšmę score
kiekvienai eilutei iš test.csv.
Galutinis vertinimas bus atliekamas naudojant MAE (Mean Absolute Error), apskaičiuojamą taip:
4 užduoties metrika yra:
1-3 užduotims atsakymai vertinami tiksliai.
Failas submission.csv turi turėti po 4 eilutes kiekvienai testo eilutei,
atitinkančias 4 užduotis.
Struktūra:
subtaskID datapointID answerStulpelių reikšmės:
subtaskID – skaičius nuo 1 iki 4
datapointID – sampleID iš testo
answer – rezultatas:
Short / Medium / LongsampleID = 1714:subtaskID datapointID answer1 1714 Medium2 1714 153 1714 34 1714 3.74Sėkmės! Didžioji Archyvarių Taryba deda viltis į jus, kad atgaivintumėte Panašumo orakulą! 🧙♂️