Uzdevums #39
Autors:Mihai Nan
Grūtības pakāpe
Jūsu labākais rezultāts
Nav pieejams
Lielās Karalistes bibliotēkā arhivāri saskaras ar arvien sarežģītāku uzdevumu:
tūkstošiem manuskriptu, pergamentu un vecu hroniku ir jāorganizē, jāsalīdzina un jāindeksē.
Lai viņiem palīdzētu, senči ir radījuši leģendāru mehānismu: Līdzības orākuls. Tas ir
ierīce, kas spēj ar ievērojamu precizitāti noteikt, cik līdzīgi
ir divi teksta fragmenti, atgriežot punktu skaitu no 0 līdz 5.
Bet mehānisms laika gaitā ir degradējies, un Lielā Arhivāru padome ir nolēmusi, ka ir nepieciešama
moderna versija, kas būvēta, izmantojot mašīnmācīšanos.
Šim nolūkam tev ir nodoti divi faili:
train.csv - pergamenti, ko manuāli anotējuši rakstvežitest.csv - jauni pāri, kas jāanalizē ar tavu risinājumuTavs uzdevums ir rekonstruēt Orākulu ar analīžu sēriju un gala prognozējošo modeli.
Katrs rindas no failiem train.csv un test.csv reprezentē teikumu pāri:
Galīgais mērķis ir prognozēt score katram rindam no test.csv.
Pirmajiem apakšuzdevumiem jāanalizē dati, kas sniegti train.csv un test.csv
un jāizvelk dažāda svarīga informācija par teikumiem no testa.
Aprēķiniet katra teikuma garumu (sentence1 un sentence2) katram rindam no testa kopas
un etiķetējiet pāri atkarībā no vidējā garuma:
Short ja vidējais < 50Medium ja 50 ≤ vidējais < 100Long ja vidējais ≥ 100Katram rindam no testa, aprēķiniet vārdu skaitu katrā teikumā (sentence1 un sentence2) un nosakiet kopējo skaitu pēc formulas:
kopējais_skaits = vārdu_skaits(sentence1) + vārdu_skaits(sentence2)Nosakiet absolūto starpību starp sentence1 garumu un sentence2 garumu
katram rindam no testa.
Citiem vārdiem sakot, katram rindam jāaprēķina:
|rakstzīmju_skaits(sentence1) - rakstzīmju_skaits(sentence2)|Izveidojiet mašīnmācīšanās modeli, kas spēj prognozēt skaitlisko vērtību score
katram rindam no test.csv.
Galīgais novērtējums tiks veikts, izmantojot MAE (Mean Absolute Error), kas aprēķināts šādi:
Metrika 4. apakšuzdevumam ir:
1.-3. apakšuzdevumiem atbildes tiek novērtētas precīzi.
Failam submission.csv jāsatur 4 rindas katram testa rindam,
kas atbilst 4 apakšuzdevumiem.
Struktūra:
subtaskID datapointID answerKolonnu nozīme:
subtaskID – skaitlis no 1 līdz 4
datapointID – sampleID no testa
answer – rezultāts:
Short / Medium / LongsampleID = 1714:subtaskID datapointID answer1 1714 Medium2 1714 153 1714 34 1714 3.74Veiksmi! Lielā Arhivāru padome liek cerības uz jums, lai atdzīvinātu Līdzības orākulu! 🧙♂️