Problem #39
Författare:Mihai Nan
Svårighetsgrad
Din bästa poäng
Ej tillgänglig
I Stora Rikets Bibliotek står arkivarierna inför en allt svårare uppgift:
tusentals manuskript, pergament och gamla krönikor måste organiseras, jämföras och indexeras.
För att hjälpa dem har förfäderna skapat en legendarisk mekanism: Likhetsoraklet. Detta är
en apparat som kan fastställa, med anmärkningsvärd precision, hur lika
två textfragment är, och returnera en poäng mellan 0 och 5.
Men mekanismen har försämrats över tid, och Arkivariernas Stora Råd har beslutat att det behövs
en modern version, byggd med hjälp av maskininlärning.
För detta har du fått tillgång till två filer:
train.csv - pergament manuellt annoterade av skrivaretest.csv - nya par som behöver analyseras av din lösningDin uppgift är att rekonstruera Oraklet genom en serie analyser och en slutlig prediktiv modell.
Varje rad i filerna train.csv och test.csv representerar ett par meningar:
Det slutliga målet är att predicera score för varje rad i test.csv.
För de första deluppgifterna måste du analysera data som tillhandahålls i train.csv och test.csv
och extrahera olika relevant information om meningarna i test.
Beräkna längden på varje mening (sentence1 och sentence2) för varje rad i testuppsättningen
och märk paret baserat på medellängden:
Short om medelvärdet < 50Medium om 50 ≤ medelvärdet < 100Long om medelvärdet ≥ 100För varje rad i test, beräkna antalet ord i varje mening (sentence1 och sentence2) och bestäm det totala antalet enligt formeln:
totalt_antal = antal_ord(sentence1) + antal_ord(sentence2)Fastställ den absoluta skillnaden mellan längden på sentence1 och längden på sentence2
för varje rad i test.
Med andra ord, för varje rad måste vi beräkna:
|antal_tecken(sentence1) - antal_tecken(sentence2)|Bygg en maskininlärningsmodell som kan predicera det numeriska värdet score
för varje rad i test.csv.
Den slutliga utvärderingen kommer att göras med MAE (Mean Absolute Error), beräknat enligt:
Måttet för Deluppgift 4 är:
För deluppgifter 1-3 utvärderas svaren exakt.
Filen submission.csv måste innehålla 4 rader för varje rad i test,
motsvarande de 4 deluppgifterna.
Struktur:
subtaskID datapointID answerBetydelsen av kolumnerna:
subtaskID – ett nummer mellan 1 och 4
datapointID – sampleID från test
answer – resultatet:
Short / Medium / LongsampleID = 1714:subtaskID datapointID answer1 1714 Medium2 1714 153 1714 34 1714 3.74Lycka till! Arkivariernas Stora Råd sätter sitt hopp till er för att återuppliva Likhetsoraklet! 🧙♂️